在AI大模型领域竞争愈发激烈的背景下,字节跳动创始人张一鸣近期在内部会议上的表态引发行业热议。他明确表示,字节跳动不会采用AI蒸馏技术改进模型,认为这种做法会阻碍真正意义上的长期技术突破。这一观点与当前部分企业通过技术捷径提升模型性能的做法形成鲜明对比。
模型蒸馏技术作为知识迁移的重要手段,其原理类似于教育场景中的师生互动。清华大学刘嘉教授在《通用人工智能》中解释,该技术通过已训练好的大型模型指导小型模型训练,使后者在保持高效的同时接近前者的性能。这种"教师-学生"模式的核心在于,小型模型不仅学习正确答案,更模仿大型模型的推理逻辑。
尽管技术本身具有中立性,但实际应用中引发的争议持续升级。今年初,Anthropic指控多家中国公司通过虚假账户与其模型交互实施"蒸馏攻击",引发行业对技术伦理的讨论。月之暗面副总裁黄震昕则强调,K3模型的性能提升源于底层架构创新,而非对现有模型的简单复刻。这种技术路线的分歧,反映出行业对创新本质的不同理解。
支持者认为,蒸馏技术显著降低了模型训练成本。一个小型模型通过学习大型模型的推理过程,可在算力消耗大幅降低的情况下达到相似效果。Anthropic等公司采用的"自蒸馏"策略,即用自身大模型训练小模型,已成为行业通行做法。英伟达创始人黄仁勋更公开表示,蒸馏是智能发展的基础,AI需要通过这种学习方式实现进步。
然而技术优势背后隐藏着深层风险。过度依赖蒸馏可能导致模型同质化,削弱行业创新能力。当所有模型都基于同一基础模型优化时,真正的原创性突破将难以实现。更值得关注的是文化自主性问题,刘嘉教授指出,蒸馏模型可能在无形中继承原始模型的价值体系,这对需要保持文化独立性的应用场景构成潜在威胁。
字节跳动的选择在业内引发两极评价。部分观点认为,技术路线选择本无对错,关键在于企业战略定位。但也有批评指出,其豆包模型在复杂推理和代码生成能力上与头部产品存在明显差距,"不蒸馏"策略可能是导致落后的主要原因。在海外模型持续领先的现状下,市场是否愿意为"长期主义"买单存在疑问。
国内开源模型的发展态势加剧了这种压力。OpenRouter数据显示,开源模型处理的token占比在半年内从34%跃升至65%。仅6-7月间,就有智谱GLM-5.2、Kimi K3等多个新模型发布,这些产品在代码生成、多模态处理等领域已接近国际顶尖水平。这种快速迭代的环境,对坚持自研路线的企业构成巨大挑战。
字节跳动管理层多次强调技术自主的重要性。CEO梁汝波在全员会上表示,接受短期落后是坚持自研的必要代价,公司将继续优化基础能力。火山引擎总裁谭待以视频模型为例说明,只有达到SOTA水平的模型才能创造商业价值,这需要长期的技术积累而非短期技巧。






