最近,Qwen3.8-27B 模型刚刚发布时,我就感到这个模型的潜力非常惊人。它的参数仅有 27B,并且在经过量化后体积缩小到十几 GB,使得一张 RTX 5090 显卡便可运行。然而,当时的测试数据主要来源于千问的官方发布,因此我一直认为需要等待第三方评测结果。如今,Artificial Analysis 的最新评测终于揭晓,结果让我惊讶不已。简单来说,如果把目前全球各大流行模型进行一次“综合评测”,Qwen3.8-27B 的表现与 GPT-5.6 Luna 不相上下,甚至能够与 DeepSeek V4 Pro 平起平坐,明显超过了 Claude Opus 4.6 Max 和 MiniMax M3。要知道,Claude Opus 4.6 在半年前可是全球最顶尖且价格最昂贵的大模型之一,而如今一个仅有 27B 的中国开源模型竟然超过了它。
更令人惊叹的是该模型的 Agent 能力。Agent 可以理解为:之前 AI 主要是“回答问题”,而现在我们希望 AI 实际上能替我们处理事务。例如,让 AI 自主操作电脑、调用特定工具、编写代码、查阅资料等,从而完成相对复杂的任务。在这一点上,Qwen3.8-27B 的表现甚至超过了 GPT-5.6 Terra、DeepSeek V4 Pro 和 Claude Opus 4.8 Max 等许多更为庞大的模型。换句话说,这款可以在一张消费级显卡上运行的模型,其 Agent 能力已经跻身全球一流行列,这正是此次评测让我最为震撼的部分。
过去,当我们提到“顶级 AI”,脑海中很可能浮现出庞大的数据中心、一排排昂贵的 GPU,和普通企业难以承担的算力。但如今,这种强大能力正在被压缩至仅一张显卡之内。用户可以直接在个人电脑或服务器上部署该模型,使公司代码无需上传至云端,客户资料可安全保留在本地,内部文档也可保持在本环境中。更棒的是,企业还能够用自身的数据进行微调,让 AI 更好地理解自身业务。同时,也不必担心 Token 的使用限制。一旦购买了硬件,想让它处理多少资料、编写多少代码、运行多长时间都不需再计算 API 成本。
我愈发觉得,Qwen3.8-27B 的出现可能比推出更大型的 2T、3T 模型更具意义。因为它所引发的变化不仅在排行榜上,更在于谁能够真正掌握顶级 AI。这种模式的影响已经显现。根据最近的数据,阿里巴巴的开源权重模型在过去六个月内,全球累计下载量超过了 30 亿次,超越了 Meta 和 Alphabet 以及国内其他竞品,位居全球首位。这也反映了一种现实需求:大家固然希望拥有全球最强模型,但企业和开发者同样需要一个足够强大、可运行、可部署且真正属于自己的模型。
半年前,我们还在讨论中国开源模型何时能够追赶上全球顶级的闭源模型,而现在,一个能够在消费级显卡上运行的 27B 模型,已经和它们共同站在了这个领域。如今,顶级 AI 的规模也许并不需要达到那么“大”。
将运动融入生活,让健康常伴左右!...
将运动融入生活,让健康常伴左右!...