最近几个月我发现,我订阅的 token 套餐越来越多,但是 token 好像越来越不够用。 也不知道是项目多了,还是各大厂商给的 token 缩水了。 反正钱没少花,token 焦虑反而越来越大了。 直到前几天,阿里发了 Qwen3.8-27B,官方跑分直接媲美 Claude Opus 4.6,还几乎全部是在 Claude Code 上跑出来的,而且开源,随便下载,不要钱。 热度也很夸张。发布 48 小时冲上 Hugging Face 趋势榜第一,当天在 Hacker News 登顶,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。编程工具 Cline 宣布,上线仅 4 天,它就成了 Cline 开发者选得最多的本地模型。CNBC 和 The Information 也都专门做了报道。 Hugging Face 趋势榜,Qwen3.8-27B 排第一 Ollama,vLLM,SGLang 全是 day-0 支持,连 Cloudflare 都第一时间把它收进了 Workers AI 模型库,AMD 官方也出了 Ryzen AI Max 的部署教程。这个待遇,今年在开源模型里真没见过几次。 这激发了我的兴趣,索性直接把它装进了我的 Mac,实测下它到底有没有网上评价的那么好。 1 . 先说清楚它是什么 Qwen3.8-27B,270 亿参数,稠密模型,啥意思呢,每生成一个字,270 亿参数全员上场干活,不像有些模型只派一小队人。Apache 2.0 协议开源,权重随便下载,商用也不要钱。官方给这代定的调子叫「A New Bar for Coding and Cowork」,主打就是编程和办公协作。 它还有个 2.4 万亿参数的大哥 Qwen3.8-2.4T-A95B,这次权重也一起放出来了,这是 Qwen 第一次把 Max 级别的模型开放权重。不过 2.4T 那个开放权重版是纯文本模型,不带视觉,而且那个体量普通人根本跑不动。27B 才是你能搬回家的那个。 原生多模态,能看懂图片和视频,官方口径连小时级的长视频都能理解。注意,是看懂,不是生成,想让它画图的可以散了。 本地跑边界框检测,框出照片里的鹈鹕 比如上面这个,让模型把照片里的鹈鹕一只只框出来,框得相当准。这种能力放在 agent 流程里很值钱,识图,读文档,看截图写代码,都用得上。 上下文原生 262K,官方说用一种叫 YaRN 的技术能扩展到 1M。你可以理解为,262K 是训练出来的原装量程,1M 是给尺子末尾硬接了一段估算刻度,量是能量,精度没经过校准。所以 1M 目前只是理论值,实测大家跑到的都是 262K。 2 . 为什么都在喊「本地 Opus 4.6」 Opus 4.6 发布时候的体验和断崖式领先,相信用过的人都感同身受。所以现在社区再出什么新模型,第一反应都是拿它跟 Opus 4.6 比,它就是那把尺子。 官方模型卡上的跑分确实吓人。但先说清楚,这些全是官方自己跑的分,先打对折听。 Qwen3.8-27B 官方文本跑分表 SWE-bench Pro 61.7,旁边摆的参照物是 Claude Opus 4.6 Max 的 53.4,Terminal Bench 73.0,LiveCodeBench 90.3。 多模态这边官方口径也不弱,电脑操作 OSWorld-Verified 84.3,文档理解 OmniDocBench 91.1。官方说整体能力超过自家上一代付费模型 Qwen3.7-Plus。 纸面好看归好看,实际体感怎么样?社区这几天的实测结论比较一致:日常编程和 agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,云端还是更稳。 我自己实测下来,模型能力确实还不错,中文写作和基础编程完全没问题,但就是速度慢,比不上云端 API,要是真实做项目,等待时间也是成本。 第三方榜单这边也出来了,Artificial Analysis 的 Agentic Index 刚把它收录进去,51 分,排第 7。 Artificial Analysis Agentic Index 榜单,Qwen3.8 27B 以 51 分排第 7 51 分什么概念,比前代 Qwen3.6-27B 的 28 分高出一大截,也压过了 DeepSeek V4 Pro 和 GPT-5.6 Luna。但它前面还站着 Claude Opus 5,GLM-5.3,Grok 4.6 三个 59 分的。所以准确的说法是,本地模型第一次挤进了这个榜单的第一梯队,离「干翻所有闭源旗舰」还差得远。 另一个专门测 agent 复杂任务的第三方榜单 Agents' Last Exam 也出分了,27B 拿到 42.9%,保住了自家旗舰 Q
Copyright © 今年会(中国)官方网站 版权所有 网站地图
留言框-