凌晨三点,深圳某间出租屋里,一个 95 后程序员盯着屏幕上的数字,手开始发抖。
82.4。
他揉了揉眼睛,又看了一遍。SWE-Bench Verified 榜单上,一个名叫Ornith-1.0的模型,赫然排在了第一名的位置。
不是 GPT ,不是 Claude ,不是任何一个你叫得出名字的巨头的作品。
而是一个全参数开源的模型。
一个"不可能"的数字
如果你不熟悉 SWE-Bench ,我简单解释一下:这是目前 AI 编程领域最权威的基准测试,考的是模型能不能像真人程序员一样修 Bug。
不是写个 Hello World ,不是在 Stack Overflow 上抄答案。而是给它一个真实的 GitHub issue ,让它自己读懂代码、定位问题、写出补丁、跑通测试。
难度极高。
此前,即使是闭源模型,能做到 70%以上已经非常优秀。开源模型?大多数人觉得能到 60%就谢天谢地了。
然后 Ornith-1.0 甩出了82.4。
这个数字意味着什么?意味着它在超过 1200 个真实软件工程任务中,独立解决了 82.4%的问题——而且是全参数开源,权重完全公开,任何人都可以本地部署。
幕后:一群"疯子"的两年
故事要从 2024 年初说起。
一支不到 20 人的团队,悄悄开始了一个代号为"Ornith"的项目。没有大厂背书,没有明星研究员站台,甚至没有一篇预告博客。
他们的目标只有一个:证明开源模型可以在最难的编程任务上打赢闭源。
团队成员来自各地——有前大厂的基础架构工程师,有高校的 NLP 博士生,也有自学成才的独立开发者。他们分布在十几个时区,靠 GitHub 和 Discord 协作。
两年,没有融资,没有 PR ,只有代码。
据知情人士透露,团队在训练数据上花了大量精力。他们没有简单地堆量,而是对编程数据做了极其精细的筛选和标注——每一条训练样本都经过了多轮质量审核。
"我们不是在训练一个会说代码的模型,"团队核心成员在一次内部讨论中说,"我们是在训练一个能写代码的工程师。"
为什么这件事重要?
可能有读者会问:一个跑分而已,有什么好激动的?
因为开源意味着选择权。
当最好的编程模型是闭源的,你的代码要上传到别人的服务器,你的商业逻辑暴露在第三方的 API 里,你的数据安全完全取决于别人的承诺。
而 Ornith-1.0 的全参数开源,意味着你可以在自己的机器上、自己的内网里、自己的数据中心中,跑起一个和闭源模型一样强、甚至更强的编程助手。
这对企业意味着数据安全的根本保障。
对开发者意味着不再依赖任何 API 的定价和限制。
对整个 AI 行业意味着——天花板从来不在技术本身,而在开放的意愿。
接下来的故事
Ornith-1.0 的发布在技术圈引发了一场小小的地震。
有人连夜下载权重做评测,有人开始研究它的架构细节,还有人已经着手在它的基础上做微调适配。GitHub 上的相关仓库, 24 小时内 Star 数突破了 5000。
但最让人动容的,是那位凌晨三点看到数字的年轻程序员发的一条朋友圈:
"原来开源,真的可以赢。"
这或许就是 Ornith-1.0 给整个行业最大的启示——当一群足够专注的人,带着足够纯粹的动机,去做一件足够难的事情时,奇迹并不是不可能。
它只是还没发生而已。
而现在,它发生了。
封面高亮关键词: Ornith-1.0, 全参数开源, SWE-Bench 82.4, 编程模型天花板


