作者/李彦
过去几年,AI算力行业的竞争,主要围绕芯片性能和集群规模展开:单卡算力有多高、能否建设千卡或万卡集群、能不能跑通主流大模型,构成了市场评价一家GPU厂商的核心标准。但随着大模型从集中训练走向规模化应用,这套标准正在发生变化。
变化首先来自AI的使用方式。生成式AI阶段,词元消耗主要由用户的一次次提问触发;进入智能体阶段后,AI开始替人阅读资料、拆解任务、调用工具和验证结果。用户只下达一次指令,智能体可能在后台连续调用模型数十次甚至上百次。
这意味着,算力基础设施正在从提供计算资源,进一步变成持续生产模型和词元的系统。行业关注的问题也变得更加具体:一套集群能否长时间稳定训练前沿模型,能否快速适配不断更新的模型,单位词元成本能否继续下降,以及能不能承接智能体和物理AI带来的新需求。
基于这一趋势,摩尔线程此次提出三类“AI工厂”,分别对应模型训练、词元生产和智能体生产。在摩尔线程创始人、董事长兼CEO张建中看来,这类似于传统工业中的不同工厂:模型训练工厂负责训练不同模型,词元生产工厂负责提供Token服务,智能体生产工厂则负责训练数字智能体和物理智能体的思维方式与行动能力。
模型训练工厂首先解决的是国产GPU能否真正进入大模型核心训练环节的问题。过去,国产算力能够完成模型适配或小规模测试,并不等于可以承担持续数周的大规模训练。训练规模越大,芯片、通信、存储和软件之间的协同难度就越高。一张卡或一个节点出现问题,都可能影响整体进度。模型公司真正关心的,除了理论性能,还有扩展效率、有效训练时长、断点续训能力和最终收敛精度。
摩尔线程披露,其夸娥智算集群的线性扩展效率最高达到95%,有效训练时长占比超过90%,并已完成MoE-236B基础模型从零训练,以及北京大学5D世界模型EvoPhys-World的全栈原生训练。围绕训练过程,公司还补齐了从底层MUSA架构、算子库到训练框架和强化学习工具的软件栈,适配PyTorch、Megatron-LM、DeepSpeed、VeRL和Slime等主流生态。
这些进展的意义在于,国产GPU正在从“能跑开源模型”向“能原生训练模型”推进。对于模型厂商而言,只有训练精度、稳定性和软件工具达到可用水平,国产算力才有机会进入其长期研发体系,而不只是作为特定条件下的补充方案。
词元生产工厂对应的是推理成本问题。当AI应用进入日常经营,企业越来越少单独讨论芯片参数,转而计算每生成一个词元需要多少成本、响应速度有多快、现有设备能否继续利用。正如张建中所说,词元工厂最典型的用户痛点,是“来一个新的模型,能不能很快就在工厂里部署服务,成本能不能降到最低”。
摩尔线程的方案一方面是适配SGLang、vLLM等主流推理框架,覆盖语言、视觉、语音和视频生成场景,并争取对DeepSeek、MiniMax、GLM、Kimi、Qwen等模型实现快速适配;另一方面是通过PD分离,将计算密集的Prefill环节和带宽敏感的Decode环节分配给不同芯片。
这套方案值得关注的地方在于,它没有将国产GPU与国际GPU简单处理成替代关系,而是尝试让两者进入同一套异构系统。摩尔线程披露,在一项测试中,3台MTT S5000与2台国际主流GPU组合,可以获得接近9台同类国际GPU的推理能力。具体效果仍需更多业务场景验证,但对已经采购大量不同型号芯片的企业而言,异构部署既能保留存量设备,也能让国产GPU逐步进入现有算力体系,降低迁移成本。
第三类是智能体生产工厂。随着AI从聊天框进入办公软件、机器人和智能终端,算力需求开始延伸至跨应用操作、图形渲染、物理仿真和数字孪生。摩尔线程为此推出具身智能仿真平台MT Lambda,用于机器人的仿真训练和Sim-to-Real迁移;同时展示数字智能体“小麦”、AI算力本MTT AIBOOK和家庭AI中枢MTT AICUBE,试图把数据中心算力进一步延伸至个人工作和家庭场景。
整体来看,摩尔线程围绕模型训练、规模化推理和智能体落地,搭建一套覆盖云、边、端的算力体系。这也反映出国产GPU行业正在进入新的竞争阶段。芯片能否点亮、模型能否跑通,已经逐渐成为基础门槛;接下来真正拉开差距的,将是集群稳定性、软件生态、单位词元成本和真实业务利用率。市场最终购买的,也不只是一张性能更高的计算卡,而是一套能够持续生产模型、词元和智能体的基础设施。
24小时热榜
热门视频
