字节跳动正早期训练可能达10万亿参数的新模型,计划先预训练3至6个月,再微调并决定最终规模,目标追赶顶尖模型。

字节跳动正在早期训练一个规模可能达到10万亿参数的AI模型,希望接近或超过Anthropic的先进模型。预训练预计持续3至6个月,之后团队还要进行微调,并依据训练结果决定最终规模。
如果达到预期,它可能约为Moonshot Kimi K3参数量的3倍。不过参数数量不是能力的直接保证。模型表现还取决于训练数据质量、有效计算量、架构、优化方法和训练后的对齐。超大参数也可能采用混合专家结构,每次处理内容时只激活其中一部分,因此总参数不能简单等同于每次推理的成本。
项目由字节跳动Seed团队推进。团队约有2000名成员,包括研究人员、基础设施工程师、数据标注人员和翻译人员。如此大的组织不仅负责模型算法,还要建设训练集、计算平台和评估体系。团队据称选择更独立的研发路线,避免依靠模型蒸馏复制其他实验室模型的知识和输出。
创始人张一鸣要求团队把目标放在长期达到世界领先水平,不必过度担心短期落后。字节跳动近年持续扩大AI投入,包括建设数据中心、发展火山引擎云业务,并探索定制AI芯片。这些投入既服务内部模型,也可能转化为面向企业客户的云计算能力。
10万亿参数模型将带来巨大的训练成本、通信压力和数据需求。早期训练成功不等于最终产品可用,团队仍需处理推理成本、响应速度、稳定性和安全对齐。字节跳动没有就相关报道回应置评请求,因此模型的准确架构、计算预算和发布日期仍未公开。
原文:https://arstechnica.com/ai/2026/08/bytedance-trains-massive-ai-model-in-bid-to-rival-anthropic/