早早集市

428B参数全部开源,MiniMax这步棋走对了

KairosKairos

428B 参数全部开源, MiniMax 这步棋走对了

凌晨刷到一条消息,愣了三秒。

MiniMax 把 M3 模型的权重,直接传到了 HuggingFace 上。428B 总参数, 23B 激活——这体量,放到一年前,只有 OpenAI 和 Google 敢玩。

而现在,一家中国公司说:权重全开,随便下载。

这不只是一个模型,是三个能力焊在一起

看 M3 的参数表,第一反应是"贪心"。

编码与 Agent 能力: SWE-Bench Pro 59.0%, Terminal Bench 2.1 66.0%, SWE-fficiency 34.8%, KernelBench Hard 28.8%, MCP Atlas 74.2%。这串数字翻译成人话——它能读代码、改代码、跑测试、修 Bug ,基本是一个初级程序员的水平。

100 万 token 上下文:靠自研的 MiniMax 稀疏注意力机制实现。100 万 token 是什么概念?大概能把一整本《三体》塞进去,然后让它帮你找 bug。

原生多模态:不是后期拼上去的视觉模块,是训练阶段就一起学的。

三个能力单独拎出来都不差,焊在一起——这就是为什么圈子里的反应不是"又出一个模型",而是"这东西能跑 Agent 了"。

"权重 10 天后发布"——这句话才是重点

注意,传上去的是模型结构和技术报告,权重还要等大约 10 天。

为什么不一股脑全放出来?我猜有两个原因:

一是安全审查。428B 的模型,能力边界需要测试,尤其 Agent 能力意味着它能操作文件系统、调用 API ,不能直接裸奔。

二是节奏感。先放消息炸一波讨论,再放权重引爆第二波传播。这比"静默上线等你们自己发现"高明得多。

对比一下 DeepSeek 的路线:直接放权重+论文,学术范儿。Qwen 的路线:模型+API 同步上,商业导向。MiniMax 这次的选择,更像是一场精心设计的开源营销

开源军备竞赛,已经打到第二轮了

2024 年是开源大模型的元年, DeepSeek-V3 和 Qwen-72B 让所有人意识到:开源模型真的能用了。

2025 年进入分化期。有人做端侧(小模型),有人做垂直(医疗、法律、代码),有人开始卷 Agent 能力。

2026 年的主题词是**"Agent-ready 的开源模型"**。

MiniMax M3 就是这个赛道的新选手。它的竞争对手不是 GPT-5 或 Claude 4——那些闭源模型不在同一个战场。它真正的对手,是同样开源的 Llama 4、Qwen 3、DeepSeek V4。

这场仗的打法很清晰:谁能让开发者用最低成本跑出最好的 Agent 效果,谁就赢下生态。

23B 激活参数,藏着 MiniMax 的真实算盘

428B 总参数听着吓人,但关键数字是23B 激活参数

这意味着什么?意味着推理成本远低于同等总参数量的稠密模型。你可以把它理解成:一个有 428 个专家的团队,但每次只叫 23 个人出来干活。

这对开发者来说是实打实的好消息——跑得起,部署得了,不用租一柜子 H100。

MiniMax 显然算过这笔账。如果做一个 428B 全激活的模型,推理成本会劝退 90%的开发者。MoE 架构+稀疏注意力,既保住了参数规模带来的能力上限,又控制了推理成本。

这才是真正聪明的做法。

最后说句真话

开源模型能不能追上闭源?这个问题已经问了两年了。

我的观察是:在"通用对话"这个维度,差距已经很小了。但在"复杂推理"和"超长上下文理解"上,闭源模型仍然有优势。

MiniMax M3 试图用 100 万 token 上下文和 Agent 能力来切一个新口子。如果 10 天后放出的权重真能达到技术报告里的数字,那它至少证明了一件事——

开源模型不一定非要沿着闭源模型的路线追赶,它可以开辟自己的战场。

这步棋,走对了。

封面高亮关键词: MiniMax 开源, 428B 参数