美团发布 LongCat-2.0,1.6 万亿参数 MoE 模型,全程 5 万张国产芯片训练,在 Agent 与编程任务上接近顶级闭源模型,已开放 API 并实测可接入现有工作流。
📝 详细摘要
文章介绍了美团最新发布的万亿参数 MoE 大模型 LongCat-2.0(总参 1.6T,活跃 480B),并指出其核心意义在于「全程采用国产算力」——从预训练到大规模部署,35 万亿 tokens 的训练在 5 万张国产芯片上完成,无一次不可恢复的 loss 突刺。技术层面,模型引入了 LSA 稀疏注意力机制与 N-gram Embedding,专门优化超长上下文下的推理效率、工具调用与 Agent 稳定性。在基准测试中,Terminal-Bench 2.1、SWE-bench Pro 等编程/Agent 任务上基本追平 Gemini 3.1 Pro,通用推理(IFEval、GPQA-diamond)仍有差距。作者将模型接入 Claude Code 和 Codex 进行了实测,在文件整理、HTML PPT 生成等复杂工作流中表现连贯。文章最后强调,该模型已兼容 OpenAI/Anthropic API,只需更换 base_url 即可调用,对国产大模型生态有标志性意义。
💡 主要观点
- LongCat-2.0 验证了国产芯片训练万亿大模型的可行性。 预训练至部署全程使用 5 万张国产芯片,35 万亿 tokens 无回滚突破,证明国产算力链路打通,不再是理论可能。
💬 文章金句
- 这个分量,比多刷几个 benchmark 第一要重。
- 它把一条特别难的链路,完整跑通了一遍。
📊 文章信息
AI 初评:86
来源:卡尔的AI沃茨
作者:卡尔的AI沃茨
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2377
标签: LLM, MoE, 国产算力, AI 硬件与芯片, AI Agent