国内大模型赛道已经进入白热化的军备竞赛,不少团队依靠蒸馏快速拉高榜单分数。字节跳动Seed团队却选择踩下“捷径”的刹车,张一鸣在内部明确否决蒸馏路线,把筹码压向最高目标 10万亿参数 的超大基座。一边是视频模型Seedance站在全球第一梯队,另一边通用大语言模型公开评测排名靠后,巨额算力投入之下,字节这套“慢打法”,能否跑赢行业的时间窗口。

据英国《金融时报》援引知情人士消息,字节跳动Seed团队正在推进一款超大参数基础模型项目,最高目标瞄准10万亿参数,体量约为Kimi K3的三倍,对标Anthropic Mythos系列基座,项目尚处在预训练早期,完整训练周期预估3‑6个月,最终是否对外发布还没有确定结论。
据AI商业评论7月底报道,张一鸣罕见出席Seed两千人规模的全员内部会议,明确提出 不能使用竞品模型输出换取短期榜单排名 ,坚持不依靠蒸馏做能力提升。报道提及,在DeepSeek‑R1发布、Blackwell芯片部署落地、Kimi K3开源这三个关键节点,团队内部三次讨论是否启用蒸馏方案,每一次都被张一鸣否决。
“蒸馏技术可以快速逼近对手水平,但只能做模仿者,很难实现真正超越,我们愿意为长期目标牺牲一部分短期收益。”张一鸣在Seed内部全员会上表态。
蒸馏:行业通用捷径,字节主动关上这扇门
在大模型行业,蒸馏早已是非常普遍的技术手段。简单来讲,就是拿成熟的头部模型充当“老师”,用老师的输出数据训练自家模型,成本更低、迭代速度快,短时间就能拉升跑分 ,国内多家主流模型厂商都不同程度采用这条技术路径。
但这套方案同样存在无法回避的技术短板。牛津大学与Meta联合研究显示,过度依赖外部合成数据训练,会出现 模型坍缩现象 ,长尾知识、小众逻辑信息会发生不可逆丢失;除此之外还会带来词表偏移、奖励模型对齐错位等隐患,模型的价值取向、推理范式会被“老师模型”束缚住。
当然,技术层面的合理性,不等于商业竞争中的最优解。
据第三方榜单数据,字节当前主力基座Seed2.1 Pro在全球LLM排行榜位列第21位,而同期Kimi K3、阿里Qwen3.8‑Max稳居榜单前四梯队。字节CEO梁汝波在8月6日的年中全员会上也公开承认:大语言模型和海外领先模型的差距有所拉大,可以接受短期落后,坚持打好底层技术基础 ,同时否认字节拒绝蒸馏是迫于外部压力,属于内部长期路线选择。
“蒸馏本质上是拿来别人的范式,去拟合别人的答案,适合追赶,不适合定义下一代模型能力边界。但代价就是,你要忍受一段时间的跑分落后,还要承担巨额训练成本。”AI产业独立研究员江屹这样解读字节的路线选择。
10万亿参数豪赌:不止是堆参数,数据、资金两道大关横在眼前
否决蒸馏捷径之后,字节给出的解法,是冲击10万亿参数超大模型,这套思路延续字节过往“大力出奇迹”的工程风格,但大模型领域,规模不等于胜利。
Chinchilla经典研究早已验证:模型参数翻倍,训练高质量数据也需要同步增长。Epoch AI机构测算,全球可获取的人类高质量公开文本Token总量有限,按照当下行业消耗速度,公开高质量数据集或将在2026‑2032年消耗殆尽。不走蒸馏路线,就意味着字节必须自建大规模高质量多模态数据集,全部依靠原生原始素材完成训练 ,这也是近期Seed团队把预训练数据升级为一级部门的核心原因。
资金账本的压力更加直观。据《南华早报》相关报道,字节2026全年AI相关资本开支预计超过2000亿元,绝大多数流向算力采购、智算中心建设。
据晚点LatePost报道,C端产品豆包坐拥数亿月活,但是现阶段商业变现能力偏弱,收入主要来自电商导流佣金,日均收入不足百万元;反观视频生成业务Seedance 2.0,年化收入达到20亿美元,单月收入超10亿元,现阶段视频业务收入基本用来对冲豆包的巨额算力开销,形成“视频赚钱养大语言模型”的局面。
即便拥有充足资金,超大MoE模型训练本身风险极高:训练稳定性、推理延迟、落地部署成本都是巨大难题。即便预训练顺利跑完,后续对齐、微调、安全加固还需要消耗巨量资源,最后产出未必可以直接商用上线。行业内不少技术人士认为,10万亿参数更偏向Moonshot探索项目,而非确定要落地的产品。
明显偏科:视频能力领跑,通用基座成为短板
放在整个国内AI产业视角,字节已经交出很亮眼的答卷,但能力分布极度不均衡。
视频生成赛道,Seedance 2.0属于全球一线水准,也是火山引擎MaaS业务的收入支柱;可产业客户真正刚需的能力,例如复杂代码生成、长文档深度推理、复杂Agent任务拆解,恰恰是字节通用大模型的薄弱环节。
这种能力差距,甚至映射到行业展会的选择上。2026 WAIC世界人工智能大会,国内最重要的ToB产业AI舞台,字节没有设置独立官方展台,仅做合作露出;但同期ChinaJoy游戏展,字节为抖音直播、朝夕光年搭建大面积展位。不是放弃B端市场,底层现实是 通用基座还不足以支撑企业客户复杂业务工作流,缺少可以对外展示的成熟生产力方案 。
为了解决基座短板,字节内部也进行大规模组织手术:飞书业务拆分重组,产品团队并入豆包,GTM团队划归火山引擎,元老级负责人汇报链路发生调整;Seed团队完成架构重构,拆分四大一级部门,把数据、强化学习、B端后训练、C端对话做明确拆分,目标就是消除重复研发,集中资源攻坚超大模型。但大规模组织调整同样伴随阵痛,核心人才流失、团队磨合、考核目标重构,都会拖慢产出节奏。
最大的拷问:长期主义,耗得起竞争的时间窗口吗
张一鸣提倡的延迟满足,前提是留给自己的时间足够充裕。但当下AI行业,是典型赢家通吃赛道,用户心智一旦固化,迁移成本极高。
国内市场上,Kimi、智谱、DeepSeek不断迭代新版本,持续抢占开发者、企业用户心智;海外市场,Anthropic、OpenAI持续迭代旗舰基座。用户对付费大模型不会为“未来很强”买单,付费会员要的是当下就可以感知到的能力跃升。豆包在2026年5月上线三档付费会员,社交平台上出现不少用户吐槽,核心矛盾就是付费之后,模型综合能力没有形成碾压级优势。
地缘风险也是绕不开的变量。2026年以来Anthropic多次公开指控国内厂商蒸馏Claude系列模型,字节没有出现在指控名单,一部分观点解读为坚持自研规避制裁风险;但也有行业观点认为,现阶段字节通用大模型能力,还没有达到需要被重点针对的级别。
当然,我们不能仅凭榜单分数去直接评判一家企业的技术实力。评测榜单只能覆盖有限任务集,不能完全等同于真实业务落地表现。
字节现在的处境十分清晰:主动放弃蒸馏这条捷径,用海量资金、组织资源去赌下一代超大基座的突破。但10万亿参数模型能否训练成功、训练完成之后能不能转化为产品竞争力,全部都是未知数。
梁汝波在年中会上强调“高度优先,粗主干,优化长期”。不过商业世界不会单纯为“技术洁癖”买单。巨额投入换来的,究竟是实现弯道超车,还是一场昂贵的技术实验,最终答案要等到下一代模型交出实际成果之后,才能看见。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










