
美团发布LongCat-2.0:首个在五万卡国产算力集群完成训练的万亿参数大模型
美团技术团队正式发布LongCat-2.0,这是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。该模型总参数量达1.6T,原生支持1M超长上下文,采用从零开始的预训练方式。其核心设计目标是提升Agentic Coding任务中的代码理解、生成与执行效率,标志着国产算力在大模型领域的重大突破。
核心要点
- 规模突破:LongCat-2.0 总参数量达到 1.6T,是国产算力集群支撑下的顶级规模万亿参数模型。
- 算力底座:该模型在五万卡规模的国产算力集群上实现了从训练到推理的全流程跑通,验证了国产硬件的超大规模协同能力。
- 技术特性:原生支持 1M(百万级)超长上下文,并采用动态激活机制(激活参数范围 33B~56B)。
- 应用聚焦:模型自始至终围绕 Agentic Coding(智能体编码)任务设计,旨在提高代码理解、生成与执行的效率与稳定性。
详细分析
国产算力集群的工程化里程碑
LongCat-2.0 的发布不仅是一个模型的更新,更是国产算力基础设施能力的集中展示。在五万卡规模的国产算力集群上完成全流程训练与推理,意味着在底层通信拓扑、算力调度、容错机制以及软硬件协同优化方面均达到了行业领先水平。这种规模的集群管理极具挑战,LongCat-2.0 的成功预训练证明了国产算力底座已经具备支撑万亿参数模型从零开始(From Scratch)进行全流程开发的能力,打破了超大规模模型训练对特定海外硬件的依赖。
万亿参数与动态激活的架构演进
在架构设计上,LongCat-2.0 展现了极高的效率平衡。虽然其总参数量高达 1.6T,但通过先进的架构设计,其平均激活参数仅为 48B,且激活范围在 33B 至 56B 之间动态调整。这种设计确保了模型在拥有万亿级“知识容量”的同时,能够保持较高的推理效率和响应速度。这种动态激活机制使得模型在处理不同复杂度的任务时,能够灵活调用计算资源,从而在真实的生产环境中实现性能与成本的最优解。
原生 1M 长上下文与 Agentic Coding 的深度融合
LongCat-2.0 原生支持 1M 超长上下文,这一特性对于代码领域具有决定性意义。在真实的 Agentic Coding 场景中,模型往往需要理解整个代码库(Codebase)的上下文、依赖关系以及长达数万行的文档。1M 的上下文窗口使得模型能够“一次性”读取并理解超大规模的项目代码,从而在代码生成、Bug 修复和系统重构等任务中表现出更高的稳定性和准确性。其核心目标是让 AI 不仅仅是一个辅助写代码的工具,而是成为能够独立完成理解、生成与执行闭环的智能体。
行业影响
LongCat-2.0 的问世对 AI 行业具有多重深远影响。首先,它提振了市场对国产算力生态的信心,证明了国产芯片集群在处理万亿级模型时的可靠性。其次,该模型将万亿参数模型的应用场景精准锚定在 Agentic Coding 领域,推动了软件工程自动化向更高阶的智能体阶段演进。最后,1M 原生长上下文的普及,将促使更多开发者探索超长文本处理在复杂工业场景中的落地可能性,为大模型在垂直行业的深度应用树立了标杆。
常见问题
问题 1:LongCat-2.0 的参数规模和激活机制是怎样的?
LongCat-2.0 的总参数量为 1.6T(万亿级)。它采用了动态激活机制,平均激活参数约为 48B,根据任务需求,激活参数会在 33B 到 56B 之间动态波动,从而兼顾模型容量与推理效率。
问题 2:该模型在硬件适配上有何特殊之处?
它是业界首个在五万卡规模的国产算力集群上完成全流程训练与推理的模型。这意味着它从底层架构到上层算法都针对国产算力环境进行了深度优化,实现了全流程的自主可控。
问题 3:LongCat-2.0 主要解决什么场景下的问题?
该模型核心针对 Agentic Coding 任务进行设计。它通过 1M 超长上下文支持和万亿参数的理解能力,旨在更高效、更稳定地完成复杂代码环境下的理解、生成与自动化执行任务。


