早早集市

5倍加速背后:160 tok/s起飞,0.7 tok/s坠毁

KairosKairos

5 倍加速背后: 160 tok/s 起飞, 0.7 tok/s 坠毁

三条真实评论

Hacker News 上一个帖子标题平平无奇——"有人用本地模型替换 Claude/GPT 写日常代码吗?"

评论区只有三个人发言。但三个人恰好拼出了本地编程现状的完整切面。

arjie 拥有两张 RTX Pro 6000 Blackwell 显卡,跑 DeepSeek V4 Flash ,速度160 tok/s。他搭配 Agent 工具 Pi ,形容体验"blazing fast"。然后他说了一句很诚实的话:习惯还是让他留在 Claude Code 和 Codex。

HappySweeney 的硬件配置更怪——Optane 内存加大内存,跑 full-fat 模型。速度:0.7 tok/s。他让 Kimi 2.6 和 GLM 5.1 做 AVX512 位矩阵转置,两个模型都"failed miserably"。

tumetab1 在 Apple M4 上试了 Gemma 4 ,速度明显低于云端。他指出了一个被忽略的问题:企业级工具缺失,没人知道该怎么选本地模型。

三条评论,三种命运。本地编程的真相,就藏在这 160 与 0.7 的228 倍差距里。

5 倍加速的数据支撑

如果把视野从 HN 评论区拉回到更大的讨论池,本地编程的拥趸们确实拿出了成绩单。

一份被反复引用的追踪数据显示,在本地编程模型的讨论中,Qwen 3.6 35B-A3B33%的提及率领跑, 27B 变体以**20%紧随其后, DeepSeek Pro 和 Gemma4 31B 分列三四位。Agent 工具侧, Pi 以49%占比领先, OpenCode 以45%**紧随。

性能数据同样亮眼。SWE-bench Verified 基准上, Qwen3.6 27B 得分77.2%, 35B-A3B 得分73.4%,已逼近 Claude Sonnet 4.6 的79.6%。考虑到 35B-A3B 采用 MoE 架构,总参数 350 亿、推理时仅激活30 亿,这个逼近显得更有性价比。

加速倍数的对比更直观:Claude Opus 带来 15 倍加速,本地 Qwen 带来 5 倍加速,后者完全免费、离线运行、数据不出本机。

这是 AIHOT 给出的结论:"本地编程工具栈正在快速成熟,'迷你工厂'模式正在实时上演。"

硬件鸿沟

但 5 倍加速的前提条件,藏在 arjie 和 HappySweeney 的对比里。

arjie 的 160 tok/s ,需要两张 Blackwell 专业卡。HappySweeney 的 0.7 tok/s ,来自"Optane+大内存"这种非常规组合。两人硬件投入的差距,可能超过 10 倍。

Qwen 3.6 35B-A3B 的 MoE 设计本来是为了降低门槛——推理只激活 30 亿参数,理论上消费级硬件就能跑。但 HN 评论区的现实是,真正跑出可用速度的用户,要么有专业级 GPU ,要么愿意忍受秒级延迟。

tumetab1 在 M4 上的体验印证了这一点:消费级芯片跑本地模型,速度"明显低于云端"。他提出的第二个问题更尖锐——缺少企业级工具帮用户选择合适的本地模型。模型很多,但没人告诉普通开发者哪个能跑、哪个能写、哪个值得折腾。

初级工程师与高级工程师

一位 HN 评论者用了一个精准的比喻:

"把智能体版的 Qwen3.6 35b 和 Claude Opus 对比,就像是一个知识面广但需要你处处引导的初级工程师,与一位能和你一起思考架构的高级工程师之间的差别。"

这个比喻点出了 5 倍加速背后的代价。Qwen 可以免费跑、可以离线、可以保护隐私,但它需要开发者投入更多心智负担去引导、去纠错、去填补模型能力的缝隙。

Claude Opus 贵,但它能分担架构思考。Qwen 便宜,但要开发者自己扛架构。

能力差距只是表象,成本结构才是分水岭。15 倍加速对应的成本是 5 倍加速的数倍。对个人开发者来说,这个价差是否值得,取决于他们的时间成本和对隐私的权衡。

三层结构

HN 帖子下面三个人的选择,恰好勾勒出本地编程市场的三层结构。

arjie 代表第一层:专业硬件、愿意折腾、但习惯仍让他们留在云端。本地模型对他们来说是能力储备,日常仍付费。

HappySweeney 代表第二层:尝试过 full-fat 模型、遭遇过翻车、硬件投入产出比不佳。他们构成本地编程的劝退样本。

tumetab1 代表第三层:消费级硬件、试过一次、发现速度和工具都不够。他们构成了"想试但试不动"的大多数。

5 倍加速的叙事成立,但它服务的对象,目前只是第一层中愿意付出硬件成本的那一小部分。真正的瓶颈是硬件和工具链,模型参数早已够用。