字节跳动的10万亿参数豪赌:当TikTok公司开始直追Anthropic Mythos
2026年8月7日,英国《金融时报》发出一则报道,来自知情人士:字节跳动正在预训练一个约10万亿参数的AI模型。
10万亿。
这个数字需要一点背景才能理解它的量级。2025年7月发布的Kimi K3,目前是中国任何AI实验室公开发布的最大模型,参数量为2.8万亿。此前的DeepSeek V4-Pro是1.6万亿。字节跳动这次的目标,比Kimi K3大3.5倍以上,比目前公开估计中最接近它的Anthropic Mythos 5(业界估计约8万亿,Anthropic从未确认)还要大。
如果参数量是衡量AI能力天花板的指标(这本身是一个有争议的假设,后面会讨论),字节跳动的这一步,意味着它在试图把中国AI的能力边界推进到一个全新的高度。
更值得关注的是这条FT报道里的另一个细节:字节跳动”排除了复制竞争对手的捷径”——它选择的是从头开始进行完整的预训练,而不是在现有开源模型基础上进行微调或蒸馏。这是一个明确的信号:字节跳动要建的不是另一个”中国特色的Claude替代品”,而是一个真正独立于现有知识产权体系的原生大模型。
参数量的实际含义
在深入讨论字节跳动的战略之前,有必要先厘清”10万亿参数”的实际含义。
参数量是AI模型的规模度量,但它和实际能力的关系不是线性的,也不是唯一决定因素。更重要的指标包括:激活参数(每次推理时实际”运行”的参数数量)、训练数据的质量和多样性、训练计算量(FLOPs)、以及架构设计。
字节跳动采用的是MoE(Mixture of Experts,混合专家)架构。这种架构的特点是:模型有大量”专家”层,但每次推理只激活其中的一小部分。因此,”10万亿总参数”并不意味着每次推理都在运行10万亿参数——实际激活的参数量可能只是总参数量的1/10甚至更少。
TechTimes报道在补充背景知识时指出:MoE架构中的激活参数问题是理解这个数字的关键。”10万亿参数”的标题数字是真实的,也是令人印象深刻的,但”每次查询时有多少参数实际被激活”这个关键问题,ByteDance没有披露,任何媒体也尚未得出确定性结论。
这不是说规模不重要,而是说规模的重要性需要在正确的框架下理解。在MoE架构中,更多的总参数意味着更大的”知识库”,但并不自动等于更快的推理速度或更好的实时任务表现——训练好的大MoE模型,实际推理时可能和一个小得多的Dense模型一样快。
字节跳动的战略逻辑
理解字节跳动为什么要做这件事,需要理解字节跳动的整体AI战略背景。
字节跳动不是一家AI公司,但它依赖AI的程度比几乎任何公司都更深。TikTok的推荐算法是字节跳动整个商业帝国的核心,而这个算法的持续领先,依赖于在推荐、理解、生成内容方面比竞争对手更好的AI能力。
在这个背景下,字节跳动构建超大规模基础模型的战略逻辑是:它需要的不只是”可以调用的AI API”,而是在AI能力上的深度自主。
具体来说,有三个理由支撑这个战略:
第一,国产算力的可信性验证。字节跳动选择使用约3万块GPU进行预训练,而这些GPU是在有限的出口管制条件下获得的组合(据悉包括Nvidia和华为Ascend的混合部署)。在这个规模上成功预训练一个高性能模型,将向行业证明国产AI基础设施在前沿模型训练上的可行性,这对中国AI产业的整体信心具有示范意义。
第二,摆脱开源模型的IP风险。美国法律不确定性和知识产权风险,使得深度依赖OpenAI或Meta开源模型的中国公司面临潜在的合规风险。字节跳动选择”从头预训练”,是在主动消除这一风险。
第三,建立未来产品护城河。字节跳动的Doubao已经是中国最受欢迎的AI对话应用之一,Coze是有影响力的Agent开发平台。一个真正处于前沿能力水平的自研模型,将成为这些应用的核心竞争壁垒。依赖第三方API构建的应用,永远面临供应商变更风险;自研模型,才是真正的产品护城河。
中国AI三巨头的规模竞赛
要理解字节跳动这步棋的竞争意义,需要把它放在中国AI前沿规模竞赛的背景下。
2026年7月,月之暗面(Moonshot AI)发布了Kimi K3(2.8万亿参数),创下中国公开发布的最大模型记录,并选择开放权重(open weights)发布,在全球AI社区引发震动。
在此之前,DeepSeek以V4-Flash($0.14/M输入tokens的超低定价)和V4-Pro(1.6万亿参数)确立了自己在成本效率上的领先地位——不以规模取胜,而以”极致成本效率”为核心竞争力。
字节跳动的策略则与这两者都不同:不是”开放权重”(Moonshot),不是”极致成本效率”(DeepSeek),而是”私有超大规模模型”——用最大的参数量建立最高的能力天花板,服务字节跳动自己的产品生态,同时通过Doubao API向企业客户提供服务。
值得注意的是,这三家公司背景不同:字节跳动是广告+消费应用公司,Moonshot AI是独立AI创业公司(接受腾讯等战略投资),DeepSeek是量化对冲基金幻方科技(High-Flyer Capital)旗下的AI研究部门。不同的公司背景,直接影响了各自的商业模式选择,也解释了为什么三者选择了不同的技术路线。
这三种路线在商业逻辑上各有其合理性,但它们的竞争关系也很清晰:DeepSeek的核心用户是需要低成本API的开发者,Moonshot的核心价值是开放生态和研究社区,而字节跳动的目标是大型企业客户和消费者产品——他们需要的是最强能力,而不是最低成本或最开放的生态。
硬件挑战:30000块GPU意味着什么
字节跳动这次预训练使用了约3万块GPU,FT的报道援引知情人士。
这个数字在中国AI公司中是空前的,但放在全球前沿模型训练的背景下,仍然是”受限条件下的最优解”而不是”无约束的最大化”。Anthropic Mythos 5的训练据估计使用了超过10万块A100/H100 GPU。如果这些报道准确,字节跳动使用的算力规模约为Anthropic的30%。
但有几个因素可以在一定程度上弥补这个差距:
华为Ascend的迭代。字节跳动的GPU资源中据报道包含华为Ascend芯片。第三方性能评测(包括华为公开发布的基准数据和部分独立评测机构的测试)显示,Ascend 910系列在特定推理任务上的性能已逐渐接近英伟达A100/H100的水平,但在通用训练效率上与最新的H100/H200仍存在差距。大量国产芯片+少量进口高端芯片的混合部署,是中国顶级AI实验室在出口管制背景下的普遍策略。
算法效率。DeepSeek证明了通过训练效率优化(如GRPO、MLA注意力机制),可以用比竞争对手少得多的计算量达到接近的模型性能。字节跳动有强大的算法团队(Seed AI),在训练效率上也有自己的积累。
时间维度。预训练预计需要3到6个月。在这段时间里,外部条件可能发生变化——新的算力获取渠道、新的合规策略、或者新的架构创新。
10万亿参数的模型预计将在2026年底到2027年初完成预训练。届时,它的实际能力将通过公开发布的基准测试得到检验。在此之前,我们只知道规模。
真正的问题:规模竞赛是否仍然有效?
面对字节跳动的10万亿参数计划,最值得问的问题是:在2026年,规模竞赛是否仍然是前沿AI能力提升的最有效路径?
从技术趋势来看,答案变得越来越模糊。
一方面,”Scaling Laws”(缩放定律)——更多参数+更多数据+更多计算=更好模型——依然有效,特别是在新的数据模态(视频、多步骤推理、代码执行)上仍然有大量可利用的信号。字节跳动选择10万亿参数,是在押注规模扩展仍然有效。
另一方面,DeepSeek的崛起证明了效率和架构创新可以让”更小的模型达到更大模型的性能”——这动摇了”只有最大才能最好”的简单线性逻辑。如果测试推理(test-time compute)和强化学习路径继续成熟,未来的前沿能力可能更多依赖”更聪明地使用计算”而不是”更多的参数”。
字节跳动的10万亿参数模型,是对”规模仍然是正确路径”这个假设的一次大赌注。如果这个假设在接下来两年里仍然成立,字节跳动将通过这次预训练建立一个难以被追赶的先发优势。如果”效率革命”的速度比规模扩展更快,字节跳动的这次豪赌可能只是制造了一个在问世前就已经被更高效的小模型超越的庞然大物。
这不是一个容易判断的问题。但字节跳动赌了,用3万块GPU和数亿美元的训练成本。
我们大约会在2027年初得到答案。
全球AI竞赛地图的重新绘制
字节跳动的这步棋,放在更宏观的视角里,代表的是一个值得关注的结构性变化:AI前沿的参与者正在从”3家美国实验室+若干挑战者”的格局,演变为”多极化的真正竞争”。
2023年,前沿AI的竞争者实际上只有OpenAI、Google DeepMind和Anthropic。2024年,Meta和中国实验室作为有分量的挑战者加入。2025年,DeepSeek的效率革命让整个格局重新洗牌。2026年,字节跳动的10万亿参数计划宣告:中国AI不是在追赶,而是在争夺同一个前沿。
这种多极化有一个重要的技术含义:前沿模型的训练将同时在多条技术路线上推进——美国侧的Dense+MoE组合、规模+RLHF路线;中国侧的效率优先+规模竞赛并行。多条路线同时推进,意味着技术突破可能来自任何一个方向,而任何一个方向的突破都会迫使其他路线重新评估。
对于全球用户和企业来说,AI前沿的多极化意味着选择空间的扩大,也意味着技术路线下注的不确定性增加。在这种环境下,”我们只用一家供应商的模型”将是一个越来越脆弱的策略。
ByteDance的10T模型对TikTok意味着什么
最后,有一个经常被遗漏的角度:这个10万亿参数模型将如何服务字节跳动最核心的产品——TikTok和抖音?
TikTok目前面临的内容安全挑战,在规模和复杂度上是其他任何平台都难以比拟的:每分钟上传的视频内容量、多语言内容理解需求、不断演化的违规内容形式、以及各国监管机构对内容审核标准的差异化要求,都需要极强的AI理解能力。
一个真正前沿的自研基础模型,可以让字节跳动在内容理解、创作工具(TikTok Stitch、CapCut AI)、个性化推荐和广告定向上,摆脱对第三方API的依赖,建立更紧密的产品-模型协同优化循环。这不只是成本优化,而是产品竞争力的根本性提升。
从这个角度看,字节跳动的10万亿参数豪赌,不只是中国AI政治叙事里的一颗棋子,而是一家公司为了维护自己核心产品竞争力而做出的商业决策。理解这一点,才能真正理解它为什么值得被认真对待。
参考资料
-
TechTimes. ByteDance Begins Biggest AI Build in China, Rules Out Rival-Copying Shortcut. 2026-08-07. https://www.techtimes.com/articles/323603/20260807/bytedance-begins-biggest-ai-build-china-rules-out-rival-copying-shortcut.htm
-
Financial Times. ByteDance’s big bet on AI. 2026-07-29. https://www.ft.com/content/fde2dd97-317a-41b8-a746-d917c5680397
-
MemeBI. Three Chinese AI Models Launched in One Month — and the West Should Be Worried. 2026-08-05. https://memeburn.com/chinese-ai-models-three-launches-one-month/