
美团发布LongCat-2.0:首个在五万卡国产算力集群训练的万亿参数大模型
美团技术团队正式发布LongCat-2.0模型,这是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。该模型总参数量达1.6T,原生支持1M超长上下文,并针对Agentic Coding任务进行了深度优化,标志着国产算力在大模型全流程应用上的重大突破。
核心要点
- 万亿级参数规模:LongCat-2.0总参数量达到1.6T,平均激活参数约48B,动态范围在33B至56B之间。
- 国产算力里程碑:该模型是业界首个在五万卡规模的国产算力集群上,完成从零开始预训练及推理全流程的万亿级模型。
- 原生百万级上下文:模型原生支持1M(一百万)超长上下文,极大提升了长文本处理能力。
- 聚焦编程智能:架构设计核心目标是提升Agentic Coding任务中的代码理解、生成与执行的效率与稳定性。
详细分析
万亿参数与动态激活架构
LongCat-2.0在参数规模上实现了显著突破,其总参数量达到了1.6T。为了兼顾性能与效率,模型采用了动态激活机制,平均激活参数保持在48B左右,并根据任务需求在33B至56B的动态范围内浮动。这种设计使得模型在处理复杂任务时既能发挥万亿参数的表达能力,又能优化计算资源的消耗。该模型完全从零开始进行预训练,确保了模型架构与训练数据的深度融合。
国产算力集群的全流程验证
LongCat-2.0的发布标志着国产算力生态的重要进展。它是首个在五万卡国产算力集群上完成全流程训练与推理的大模型。这一成果不仅验证了国产大规模算力集群在支撑万亿参数模型训练时的稳定性,也证明了国产硬件在处理超大规模并行计算任务时的可靠性。从预训练到最终推理的闭环完成,为后续国产算力在大模型领域的广泛应用提供了实战范本。
原生超长上下文与Agentic Coding优化
在应用层面,LongCat-2.0原生支持1M超长上下文,这对于处理大规模代码库或长篇技术文档具有天然优势。其架构设计自始至终围绕“Agentic Coding”这一核心目标展开。通过优化,模型在真实的编程任务中表现出更高的稳定性和效率,能够更精准地进行代码理解、自动化生成以及逻辑执行,旨在为开发者提供更具实用价值的智能编程支持。
行业影响
LongCat-2.0的问世对AI行业具有双重意义。首先,它证明了在完全依赖国产算力集群的情况下,依然能够产出具备万亿参数规模且支持百万级上下文的顶尖模型,这对于提升我国AI基础设施的信心具有重要作用。其次,针对Agentic Coding的深度优化,预示着AI在软件工程领域的应用正从简单的代码补全向更复杂的自主编程代理(Agent)演进,推动了编程自动化技术的边界。
常见问题
问题 1:LongCat-2.0的参数规模和激活机制是怎样的?
LongCat-2.0的总参数量为1.6T。它采用了动态激活设计,在实际运行中,平均激活的参数量约为48B,根据任务复杂度的不同,激活范围在33B到56B之间波动。
问题 2:该模型在算力支持方面有何特殊之处?
它是业界首个在五万卡规模的国产算力集群上完成全流程(包括从零预训练到推理)任务的万亿参数模型,展示了国产算力在超大规模模型训练上的承载能力。
问题 3:LongCat-2.0主要针对哪些应用场景进行了优化?
模型核心优化方向是Agentic Coding任务,重点提升模型在真实编程场景下的代码理解、生成与执行能力,并配合1M超长上下文支持,处理复杂的长代码逻辑。