字节跳动正在训练一个参数规模可能与Anthropic最先进模型相当的AI模型,这是中国科技公司持续缩小与美国顶尖实验室差距的最新举措。
据三位知情人士透露,这家中国科技巨头目前处于训练一个多达10万亿参数模型的早期阶段,规模是迄今为止中国发布的最大模型——月之暗面Kimi K3的三倍。
其中一位知情人士表示,该模型目前正处于预训练阶段——这一阶段通常需要三到六个月——之后将进行微调,若进展顺利则对外发布。模型的最终参数规模将在后续阶段确定。
Anthropic不公开其模型的参数规模,但业界估计其最先进的Mythos 5约有8万亿参数,Fable 5约有5万亿参数。参数量决定了模型存储信息的基础容量上限,但实际能力还取决于数据质量和训练方法等其他因素。
字节跳动致力于训练全球最大规模AI模型之一,彰显了中国实验室不仅要追赶、更要超越美国同行的雄心。
仅在过去几周,月之暗面和阿里巴巴的中国模型在基准测试中表现强劲,在某些领域仅落后于Anthropic的Fable 5。Anthropic最先进的模型Mythos 5因6月份的安全问题遭到临时限制,目前仅向经批准的机构开放。
业内人士表示,多家中国实验室正在训练与Fable 5规模相当的模型,而字节跳动目前是其中追求最大规模的最具雄心的一家。
字节跳动是短视频平台TikTok的母公司,其AI研发一直保持低调,旗下模型大多不对外开放,这与许多中国同行有所不同。其最新的SeeDance模型在视频生成领域跻身全球最先进之列,而面向消费者的旗舰模型豆包则以3.24亿月活跃用户成为中国最受欢迎的AI产品。
过去三年,字节跳动在AI领域的投入力度超过其他任何中国科技巨头,持续扩建数据中心网络并大力招募研究人员。其云计算部门火山引擎也在加速发展,向企业客户提供AI解决方案。此外,字节跳动还有研发定制AI芯片的计划。
字节跳动的模型研发团队Seed由前谷歌DeepMind科学家吴永辉领衔,在中国及海外共有约2000名成员,涵盖核心研究员、基础设施工程师、数据标注团队和翻译人员。
据一位知情人士透露,Seed团队的模型研发采取了更为独立的路线,不依赖对其他实验室现有模型进行"蒸馏"的方式,这一策略已坚持了一年多。部分人士认为,这导致其研发进度相对竞争对手有所滞后。
模型蒸馏是指将大型复杂AI模型压缩为更小、更快版本的过程,具体方法是训练小模型去模仿大型"教师"模型的知识和输出。
以创始人张一鸣为首的字节跳动管理层坚信,只有独立研发才能打造出超越竞争对手的模型。
据知情人士透露,张一鸣两周前在一次内部会议上再次重申了这一立场,他告诉Seed团队,要着眼长远、以"全球领先的模型能力"为目标,不必过于担忧短期内的落后。
中国媒体晚点LatePost和The Information率先报道了张一鸣在近期内部会议上的上述表态。
字节跳动未回应置评请求。
Q&A
Q1:字节跳动正在训练的AI模型有多大规模?
A:字节跳动正在训练一个多达10万亿参数的AI模型,是目前中国已发布最大模型月之暗面Kimi K3的三倍,与Anthropic最先进模型的估计规模相当。该模型目前处于预训练早期阶段,最终参数规模将在后续确定。
Q2:字节跳动的Seed团队为什么不采用模型蒸馏方式?
A:字节跳动创始人张一鸣认为,只有独立研发才能打造出真正超越竞争对手的模型。Seed团队已坚持这一独立路线超过一年,不依赖蒸馏其他实验室的现有模型。部分业内人士认为,这一策略导致其研发进度相对竞争对手有所滞后。
Q3:字节跳动旗下有哪些主要AI产品?
A:字节跳动目前主要有两款代表性AI产品:一是视频生成模型SeeDance,在全球视频生成领域跻身最先进之列;二是面向消费者的豆包大语言模型,月活跃用户达3.24亿,是中国最受欢迎的AI应用。此外,其云计算部门火山引擎也向企业提供AI解决方案。
