不蒸馏,大模型公司的代价是什么?

摘要 · 文 | 李炤锋 编辑 | 张雨忻 “一个正常的训练管线,应该把蒸馏作为一种冷启动,让模型快速走到90分,然后再去解决后面的的那10分。”谈及蒸馏在当前LLM(大语言模型)训练的作用,一位基模研究员这样说道。 他所说的“冷启动”,是指让能力较弱的模型先学习更强模型已经跑通的答案和任务轨迹,尽快得到一个可以继续训练的基础版本。 对模型公司而言,“不蒸馏”则意味着要放弃这段加速过程,从基础能力开始自行探索。这样做的好处是,可以拥有一套更独立的训练体系,但也需要付出更长的模型迭代时间。 《智能涌现》此前曾报道,字节跳动Seed成立之初便定下“不做蒸馏”的原则。一名字节人士解释,团队希望进入全球第一梯队
阅读原文 · 36氪

文 | 李炤锋 编辑 | 张雨忻 “一个正常的训练管线,应该把蒸馏作为一种冷启动,让模型快速走到90分,然后再去解决后面的的那10分。”谈及蒸馏在当前LLM(大语言模型)训练的作用,一位基模研究员这样说道。 他所说的“冷启动”,是指让能力较弱的模型先学习更强模型已经跑通的答案和任务轨迹,尽快得到一个可以继续训练的基础版本。 对模型公司而言,“不蒸馏”则意味着要放弃这段加速过程,从基础能力开始自行探索。这样做的好处是,可以拥有一套更独立的训练体系,但也需要付出更长的模型迭代时间。 《智能涌现》此前曾报道,字节跳动Seed成立之初便定下“不做蒸馏”的原则。一名字节人士解释,团队希望进入全球第一梯队

原文:https://36kr.com/p/3938270868553093?f=rss

0 条评论 · 观点来自社区

评论区 0 条讨论

的身份发言⌘/Ctrl+Enter 发送
还没有评论,来抢沙发。