[{"data":1,"prerenderedAt":301},["ShallowReactive",2],{"page-/post/nezus/2026/07/295b":3,"surrounding-page":292},{"id":4,"title":5,"author":6,"body":7,"date":281,"description":18,"extension":282,"group":283,"lastmod":284,"meta":285,"navigation":286,"path":287,"rawbody":288,"seo":289,"showTitle":284,"sort":284,"stem":290,"tags":284,"versions":284,"__hash__":291},"content/post/nezus/2026/07/295b.md","腾讯把295B大模型塞进了单张显卡","storytelling",{"type":8,"value":9,"toc":269},"minimark",[10,15,19,22,34,37,41,48,55,58,61,64,68,74,77,80,94,97,100,105,109,115,118,124,127,130,136,143,146,150,157,160,166,169,172,179,185,188,192,195,202,209,212,215,218,221,227,230,233,238,242,245,248,251,257,260,263],[11,12,14],"h2",{"id":13},"腾讯把-295b-大模型塞进了单张显卡","腾讯把 295B 大模型塞进了单张显卡",[16,17,18],"p",{},"想象一下这个场景：你面前有一台电脑，插着一张 H100 显卡， 96GB 显存。你告诉它：\"帮我写一个俄罗斯方块的网页游戏\"。一分钟后，完整的 HTML/CSS/JS 代码出现在屏幕上，方块旋转、消行、计分，一气呵成。",[16,20,21],{},"这不是 GPT-4o ，也不是 Claude 4。",[16,23,24,25,29,30,33],{},"这是一个",[26,27,28],"strong",{},"2950 亿参数","的超大规模模型——腾讯混元 Hy3。而它，正安安静静地运行在你的",[26,31,32],{},"单张显卡","上。",[16,35,36],{},"就在上个月，这件事还是天方夜谭。",[11,38,40],{"id":39},"_598gb-的怪兽模型","598GB 的\"怪兽\"模型",[16,42,43,44,47],{},"腾讯混元 Hy3 不是普通的模型。295B 参数，在开源社区里属于",[26,45,46],{},"天花板级别","的存在。它的 Agent 能力、多语言代码生成、长文理解，都展现出了显著超越同尺寸模型、甚至比肩更大规模旗舰的智能水平。",[16,49,50,51,54],{},"但问题也很直接——BF16 精度下， Hy3 的权重文件高达",[26,52,53],{},"598GB","。",[16,56,57],{},"598GB 是什么概念？一块 H100 只有 80GB 显存，顶配 H200 也不过 141GB。要完整跑起这个模型，至少需要 4-8 张显卡组成的服务器集群。对于绝大多数开发者、创业团队和个人研究者来说，这等于一道无法跨越的硬件鸿沟。",[16,59,60],{},"\"能不能在有限的机器上，把 Hy3 也跑起来？哪怕精度上做一些让步？\"——这是开源社区呼声最高的问题。",[16,62,63],{},"腾讯混元团队听到了。然后，他们做了一个让所有人目瞪口呆的决定。",[11,65,67],{"id":66},"一刀砍掉-85的体积","一刀砍掉 85%的体积",[16,69,70,71,54],{},"答案藏在两个字里：",[26,72,73],{},"量化",[16,75,76],{},"量化不是什么新概念。简单说，就是把模型参数从高精度浮点数（ BF16/FP16 ，每个参数占 16 位）压缩到更低精度。常见的做法是压缩到 4bit、8bit ，在精度损失可控的前提下换取更小的体积和更快的推理速度。",[16,78,79],{},"但腾讯这次的操作，远比\"常见做法\"激进得多。",[16,81,82,83,86,87,90,91,54],{},"他们直接给出了一个",[26,84,85],{},"1bit 量化版本（ IQ1_M ）","——每个参数只占不到 1.5 位。Hy3 的权重从 598GB 被压到了",[26,88,89],{},"85.5GB","，体积缩小了整整",[26,92,93],{},"6.7 倍",[16,95,96],{},"这意味着什么？",[16,98,99],{},"一张 96GB 显存的推理显卡——比如 NVIDIA H100 96GB 版本，或者即将到来的 B100——就能把整个 295B 参数的模型完整装进去，独立运行推理服务。不需要多卡互联，不需要张量并行，不需要任何复杂的分布式框架。",[16,101,102],{},[26,103,104],{},"单卡跑 295B。这在半年前，属于科幻小说的情节。",[11,106,108],{"id":107},"压得下去站得起来","压得下去，站得起来",[16,110,111,112,54],{},"量化最致命的陷阱，不是技术实现的难度，而是",[26,113,114],{},"性能崩塌",[16,116,117],{},"把参数精度从 16 位砍到 1-4 位，模型会不会变笨？代码写出来还能跑吗？长文读完之后还能理解吗？",[16,119,120,121,54],{},"先看 4bit 版本（ Q4_K_M ，体积 169.9GB ，两张显卡承载）。答案相当干脆：",[26,122,123],{},"和满血版几乎没差别",[16,125,126],{},"在 Agent 能力评测上， 4bit 版本的成绩紧贴 BF16 原始模型。多语言代码生成没有明显退化。工具调用任务上同样稳如泰山。长文理解这个最容易在量化中翻车的项目， 4bit 版本也交出了贴近原版的答卷。",[16,128,129],{},"如果你追求的是\"花最少钱拿到最接近满血模型的效果\"， 4bit 版本就是答案。",[16,131,132,133,54],{},"但真正让人意外的，是",[26,134,135],{},"1bit 版本",[16,137,138,139,142],{},"按直觉，压缩到这个程度，模型应该\"变傻\"才对。但 Hy3 的 1bit 版本在主流任务上站得异常稳——",[26,140,141],{},"长文理解几乎和原始模型持平","， Agent 与代码方向也只有小幅回落。放到日常的编码辅助、工具调用、长文档处理和常规问答任务上，它已经完全够用。",[16,144,145],{},"这背后是腾讯量化团队的工程实力——不仅仅是简单的精度裁剪，而是在量化策略、校准数据和权重分布优化上做了大量工作，确保关键信息在极端压缩中依然得到保留。",[11,147,149],{"id":148},"mtp-不只塞进去还要跑得快","MTP ：不只塞进去，还要跑得快",[16,151,152,153,156],{},"模型塞进单卡只是第一步。真正要让体验可用，",[26,154,155],{},"推理速度","才是硬指标。",[16,158,159],{},"295B 参数，哪怕压缩到了 85.5GB ，逐 token 生成的速度依然感人。用户等 3 秒出一个字，比打字还慢，这谁受得了？",[16,161,162,163,54],{},"腾讯混元团队的解法是：",[26,164,165],{},"MTP 投机解码",[16,167,168],{},"MTP （ Multi-Token Prediction ）的核心思想很巧妙——让模型在生成每个 token 时，不只预测下一个，而是同时预测接下来几个 token。然后用一个验证模型快速检查这些预测，通过的就直接采纳，不通过就回退修正。",[16,170,171],{},"相当于让模型\"一口气猜好几个字\"，猜对了就节省时间。",[16,173,174,175,178],{},"腾讯专门开发了 llama.cpp 的 patch 来支持 Hy3 的 MTP 架构。实测效果惊人：开启 MTP 后，",[26,176,177],{},"接受率稳定在 60%左右","。也就是说，模型\"猜\"的每 10 个字里有 6 个是直接能用的。",[16,180,181,182,54],{},"这带来的速度提升是实打实的：",[26,183,184],{},"1bit 版本解码速度提升约 50%， 4bit 版本提升接近 60%",[16,186,187],{},"交互体验从\"慢到绝望\"变成了\"流畅可用\"。敲回车后，文字流畅地出现在屏幕上，和调用云端 API 的体验没有本质区别。",[11,189,191],{"id":190},"全部开源生态就位","全部开源，生态就位",[16,193,194],{},"更值得点赞的是，腾讯这次的做法相当\"开发者友好\"。",[16,196,197,198,201],{},"所有量化版本——1bit GGUF、4bit GGUF、GPTQ Int4——已全部开源，打包为标准 GGUF 格式，天然兼容",[26,199,200],{},"llama.cpp 生态","。配合腾讯提供的 MTP 补丁和构建指引，开发者基本可以做到\"下载即用\"。",[16,203,204,205,208],{},"GPTQ Int4 版本更是直接打通了",[26,206,207],{},"vLLM 部署","的能力，可以像线上 API 一样对外提供高并发、低延迟的推理服务。这对于想把 Hy3 集成到产品中的团队来说，几乎零门槛。",[16,210,211],{},"从 Hugging Face 到 llama.cpp ，从 GGUF 到 GPTQ 再到 vLLM ，腾讯混元选择了一条最\"接地气\"的路线：不发明新格式，不建立新围墙，直接在现有最活跃的生态里插旗。",[11,213,214],{"id":214},"大模型民主化的关键一步",[16,216,217],{},"这件事的意义，远不止\"腾讯又发了一个模型\"。",[16,219,220],{},"长期以来，顶级大模型和普通开发者之间隔着一堵墙——算力墙。295B 参数的模型，理论上\"开源了\"，但大部分人根本跑不了，看得到摸不着。这种开源，形式大于实质。",[16,222,223,224,54],{},"腾讯这次把 Hy3 压到单卡可跑，做的是",[26,225,226],{},"真正的民主化",[16,228,229],{},"一个独立开发者，一台配了 96GB 显存的工作站，现在就能在本地运行一个和云端旗舰模型匹敌的 AI 助手。不需要买 API 额度，不需要担心数据隐私，不需要依赖第三方服务。模型完全在你手里，离线也能跑。",[16,231,232],{},"对于需要处理敏感数据的企业，对于想做 AI Agent 深度定制的团队，对于在边缘设备上跑 AI 的研究者——这不只是\"便宜了几张显卡\"的问题，而是整个应用范式被打开了。",[16,234,235],{},[26,236,237],{},"大模型不再只是大公司的专属武器。它开始走进每个人的电脑、每个小团队的机房。",[11,239,241],{"id":240},"从能不能到好不好","从\"能不能\"到\"好不好\"",[16,243,244],{},"当然，我们也要诚实地说： 1bit 版本不是银弹。",[16,246,247],{},"在高精度推理、复杂数学证明、多步逻辑链等对精度敏感的任务上，压缩带来的损失仍然存在。4bit 版本是最佳平衡点，而 BF16 满血版依然是天花板场景的终极选择。",[16,249,250],{},"但问题的关键已经变了。过去我们在问：\"能跑起来吗？\"答案是否定的。现在变成了：\"在什么场景下跑最好？\"——而选项栏里填满了丰富的答案。",[16,252,253,254],{},"这恰恰是技术进步的标志：",[26,255,256],{},"门槛被踩平了，选择权回到了用户手中。",[16,258,259],{},"腾讯混元团队用一次极致的量化工程，证明了 295B 参数和单张显卡之间不是不可调和的矛盾。这对整个开源大模型社区来说，都是一个强烈的信号。",[16,261,262],{},"大模型的未来，不一定越来越\"大\"。也可以是越来越\"小\"。",[16,264,265,268],{},[26,266,267],{},"封面高亮关键词",": 295B 大模型单卡部署, 腾讯混元 1bit 量化",{"title":270,"searchDepth":271,"depth":271,"links":272},"",2,[273,274,275,276,277,278,279,280],{"id":13,"depth":271,"text":14},{"id":39,"depth":271,"text":40},{"id":66,"depth":271,"text":67},{"id":107,"depth":271,"text":108},{"id":148,"depth":271,"text":149},{"id":190,"depth":271,"text":191},{"id":214,"depth":271,"text":214},{"id":240,"depth":271,"text":241},"2026-07-15T00:00:00.000Z","md","#202607AI资讯",null,{},true,"/post/nezus/2026/07/295b","---\ntitle: \"腾讯把295B大模型塞进了单张显卡\"\ndate: 2026-07-15\ngroup: \"#202607AI资讯\"\ndescription: \"想象一下这个场景：你面前有一台电脑，插着一张 H100 显卡， 96GB 显存。你告诉它：\\\"帮我写一个俄罗斯方块的网页游戏\\\"。一分钟后，完整的 HTML/CSS/JS 代码出现在屏幕上，方块旋转、消行、计分，一气呵成。\"\nauthor: storytelling\n---\n\n\n## 腾讯把 295B 大模型塞进了单张显卡\n\n想象一下这个场景：你面前有一台电脑，插着一张 H100 显卡， 96GB 显存。你告诉它：\"帮我写一个俄罗斯方块的网页游戏\"。一分钟后，完整的 HTML/CSS/JS 代码出现在屏幕上，方块旋转、消行、计分，一气呵成。\n\n这不是 GPT-4o ，也不是 Claude 4。\n\n这是一个**2950 亿参数**的超大规模模型——腾讯混元 Hy3。而它，正安安静静地运行在你的**单张显卡**上。\n\n就在上个月，这件事还是天方夜谭。\n\n## 598GB 的\"怪兽\"模型\n\n腾讯混元 Hy3 不是普通的模型。295B 参数，在开源社区里属于**天花板级别**的存在。它的 Agent 能力、多语言代码生成、长文理解，都展现出了显著超越同尺寸模型、甚至比肩更大规模旗舰的智能水平。\n\n但问题也很直接——BF16 精度下， Hy3 的权重文件高达**598GB**。\n\n598GB 是什么概念？一块 H100 只有 80GB 显存，顶配 H200 也不过 141GB。要完整跑起这个模型，至少需要 4-8 张显卡组成的服务器集群。对于绝大多数开发者、创业团队和个人研究者来说，这等于一道无法跨越的硬件鸿沟。\n\n\"能不能在有限的机器上，把 Hy3 也跑起来？哪怕精度上做一些让步？\"——这是开源社区呼声最高的问题。\n\n腾讯混元团队听到了。然后，他们做了一个让所有人目瞪口呆的决定。\n\n## 一刀砍掉 85%的体积\n\n答案藏在两个字里：**量化**。\n\n量化不是什么新概念。简单说，就是把模型参数从高精度浮点数（ BF16/FP16 ，每个参数占 16 位）压缩到更低精度。常见的做法是压缩到 4bit、8bit ，在精度损失可控的前提下换取更小的体积和更快的推理速度。\n\n但腾讯这次的操作，远比\"常见做法\"激进得多。\n\n他们直接给出了一个**1bit 量化版本（ IQ1_M ）**——每个参数只占不到 1.5 位。Hy3 的权重从 598GB 被压到了**85.5GB**，体积缩小了整整**6.7 倍**。\n\n这意味着什么？\n\n一张 96GB 显存的推理显卡——比如 NVIDIA H100 96GB 版本，或者即将到来的 B100——就能把整个 295B 参数的模型完整装进去，独立运行推理服务。不需要多卡互联，不需要张量并行，不需要任何复杂的分布式框架。\n\n**单卡跑 295B。这在半年前，属于科幻小说的情节。**\n\n## 压得下去，站得起来\n\n量化最致命的陷阱，不是技术实现的难度，而是**性能崩塌**。\n\n把参数精度从 16 位砍到 1-4 位，模型会不会变笨？代码写出来还能跑吗？长文读完之后还能理解吗？\n\n先看 4bit 版本（ Q4_K_M ，体积 169.9GB ，两张显卡承载）。答案相当干脆：**和满血版几乎没差别**。\n\n在 Agent 能力评测上， 4bit 版本的成绩紧贴 BF16 原始模型。多语言代码生成没有明显退化。工具调用任务上同样稳如泰山。长文理解这个最容易在量化中翻车的项目， 4bit 版本也交出了贴近原版的答卷。\n\n如果你追求的是\"花最少钱拿到最接近满血模型的效果\"， 4bit 版本就是答案。\n\n但真正让人意外的，是**1bit 版本**。\n\n按直觉，压缩到这个程度，模型应该\"变傻\"才对。但 Hy3 的 1bit 版本在主流任务上站得异常稳——**长文理解几乎和原始模型持平**， Agent 与代码方向也只有小幅回落。放到日常的编码辅助、工具调用、长文档处理和常规问答任务上，它已经完全够用。\n\n这背后是腾讯量化团队的工程实力——不仅仅是简单的精度裁剪，而是在量化策略、校准数据和权重分布优化上做了大量工作，确保关键信息在极端压缩中依然得到保留。\n\n## MTP ：不只塞进去，还要跑得快\n\n模型塞进单卡只是第一步。真正要让体验可用，**推理速度**才是硬指标。\n\n295B 参数，哪怕压缩到了 85.5GB ，逐 token 生成的速度依然感人。用户等 3 秒出一个字，比打字还慢，这谁受得了？\n\n腾讯混元团队的解法是：**MTP 投机解码**。\n\nMTP （ Multi-Token Prediction ）的核心思想很巧妙——让模型在生成每个 token 时，不只预测下一个，而是同时预测接下来几个 token。然后用一个验证模型快速检查这些预测，通过的就直接采纳，不通过就回退修正。\n\n相当于让模型\"一口气猜好几个字\"，猜对了就节省时间。\n\n腾讯专门开发了 llama.cpp 的 patch 来支持 Hy3 的 MTP 架构。实测效果惊人：开启 MTP 后，**接受率稳定在 60%左右**。也就是说，模型\"猜\"的每 10 个字里有 6 个是直接能用的。\n\n这带来的速度提升是实打实的：**1bit 版本解码速度提升约 50%， 4bit 版本提升接近 60%**。\n\n交互体验从\"慢到绝望\"变成了\"流畅可用\"。敲回车后，文字流畅地出现在屏幕上，和调用云端 API 的体验没有本质区别。\n\n## 全部开源，生态就位\n\n更值得点赞的是，腾讯这次的做法相当\"开发者友好\"。\n\n所有量化版本——1bit GGUF、4bit GGUF、GPTQ Int4——已全部开源，打包为标准 GGUF 格式，天然兼容**llama.cpp 生态**。配合腾讯提供的 MTP 补丁和构建指引，开发者基本可以做到\"下载即用\"。\n\nGPTQ Int4 版本更是直接打通了**vLLM 部署**的能力，可以像线上 API 一样对外提供高并发、低延迟的推理服务。这对于想把 Hy3 集成到产品中的团队来说，几乎零门槛。\n\n从 Hugging Face 到 llama.cpp ，从 GGUF 到 GPTQ 再到 vLLM ，腾讯混元选择了一条最\"接地气\"的路线：不发明新格式，不建立新围墙，直接在现有最活跃的生态里插旗。\n\n## 大模型民主化的关键一步\n\n这件事的意义，远不止\"腾讯又发了一个模型\"。\n\n长期以来，顶级大模型和普通开发者之间隔着一堵墙——算力墙。295B 参数的模型，理论上\"开源了\"，但大部分人根本跑不了，看得到摸不着。这种开源，形式大于实质。\n\n腾讯这次把 Hy3 压到单卡可跑，做的是**真正的民主化**。\n\n一个独立开发者，一台配了 96GB 显存的工作站，现在就能在本地运行一个和云端旗舰模型匹敌的 AI 助手。不需要买 API 额度，不需要担心数据隐私，不需要依赖第三方服务。模型完全在你手里，离线也能跑。\n\n对于需要处理敏感数据的企业，对于想做 AI Agent 深度定制的团队，对于在边缘设备上跑 AI 的研究者——这不只是\"便宜了几张显卡\"的问题，而是整个应用范式被打开了。\n\n**大模型不再只是大公司的专属武器。它开始走进每个人的电脑、每个小团队的机房。**\n\n## 从\"能不能\"到\"好不好\"\n\n当然，我们也要诚实地说： 1bit 版本不是银弹。\n\n在高精度推理、复杂数学证明、多步逻辑链等对精度敏感的任务上，压缩带来的损失仍然存在。4bit 版本是最佳平衡点，而 BF16 满血版依然是天花板场景的终极选择。\n\n但问题的关键已经变了。过去我们在问：\"能跑起来吗？\"答案是否定的。现在变成了：\"在什么场景下跑最好？\"——而选项栏里填满了丰富的答案。\n\n这恰恰是技术进步的标志：**门槛被踩平了，选择权回到了用户手中。**\n\n腾讯混元团队用一次极致的量化工程，证明了 295B 参数和单张显卡之间不是不可调和的矛盾。这对整个开源大模型社区来说，都是一个强烈的信号。\n\n大模型的未来，不一定越来越\"大\"。也可以是越来越\"小\"。\n\n**封面高亮关键词**: 295B 大模型单卡部署, 腾讯混元 1bit 量化",{"title":5,"description":18},"post/nezus/2026/07/295b","gShCSMKmiGUib-m9ckedaqIbg75EHRBqleYPAm-pzE4",[293,297],{"title":294,"path":295,"stem":296},"Hermes Desktop 安装及界面功能速览","/post/nezus/2026/06/hermes-desktop","post/nezus/2026/06/hermes-desktop",{"title":298,"path":299,"stem":300},"在Vibe Coding的过程中，不要忘记自己还有产品经理的身份","/post/posts/vibe-coding","post/posts/vibe-coding",1784715236916]