Loading...

阿里Qwen小改版,成为全球AI排行榜首?

2026-09-03

今天上午,我使用了将近7000万的Qwen Token。刚吃完午餐,就看到阿里发布了Qwen3.8-Max的更新消息。老实说,看到2.4万亿个参数,我并没有太大反应,100万的上下文也显得不算特别。然而,有一个数字让我惊讶不已:0902。Qwen3.8-Max变成了Qwen3.8-Max-0902,我以为只是一次简单的版本升级。可当我查阅CodeArena的排名时,我震惊了。CodeArena是全球AI领域认可的第三方评测平台,上一版Qwen3.8-Max的得分是1669分,更新到0902后,分数居然飙升到1691分,直接跃居第一。紧随其后的是Claude Opus 5 Max,得分1688;第三名是Kimi K3,得分1674。这表明阿里此次并没有换新模型,仅仅进行了后训练的更新,便将Claude和Kimi挤到了之后。

这次更新的“0902”究竟含义何在?如今很多人谈论AI,往往首先关注参数,仿佛模型越大,能力就越强。但是Qwen的这次表现展示了一个新的视角:不改变参数,依旧“榨取”潜力。Qwen3.8-Max本身就是一个2.4万亿参数的MoE模型,100万的Token上下文没有变。这次的核心是后训练,阿里在“编码”和“AI办公”方面进行了进一步训练,使得模型在写代码、使用工具和处理复杂任务时更加得心应手。换句话说,以前我们是“扩大发动机”,现在则是研究如何让同一台发动机跑得更远。

为何聚焦“编码”?我最近使用AI创建网站时深有体会,现在AI真正的价值并不在于聊天,而在于“做事”。用AI来写代码、搭建网页并不稀奇,真正的强大在于,它能够自主拆解任务,编写代码,调用工具,发现并修复BUG,最终交付一个完整的网站。因此,CodeArena测试的正是这种多步骤推理和工具调用的能力。因此,Qwen登顶的意义在于AI正在“替代人类完成工作”,而与AI进行简单对话显然属于不同的时代。

更重要的是,Qwen还在性价比上首屈一指。根据CodeArena更新后的性价比榜单,Qwen3.8-Max-0902的综合平均成本约为每百万Tokens 5美元。这意味着,Qwen不仅得到了第一名,还在性价比上也跻身前列。作为一名草根创业者,我主要关注三点:(1)是否能够用AI进行网站建设?(2)成本是多少?(3)是否能够稳定长期使用?如果这三点能够满足,那么这个AI便会成为企业愿意投资的“数字员工”。

那么,阿里为何选择在这个时间点更新?或许答案就蕴藏在“0902”这个数字中,当前大模型的基础能力已经相近,得分皆在90分左右,此时想要提升一分的难度远大于从60分提升到80分。然而,恰恰这一分将决定谁能登上第一的宝座。Qwen从1669分跃升至1691分,本质上正是在实现这一目标。

我认为,这次Qwen夺得CodeArena的第一,真正值得关注的不是“阿里战胜了Claude”,而是大模型竞争正经历着巨大的变化:从“预训练”走向“后训练”,从“比模型的大小”转向“比模型的应用能力”。未来的大模型,可能会越来越像人类,基础模型相当于智商,而后训练则像是经验,工具调用则是行动能力,而Agent的能力决定了一个人能否完成任务。Qwen这次更新的“0902”虽小,但这个版本号背后,可能藏着未来几年AI领域的重大转变:大模型的下半场,或许将不再是争夺模型的大小,而是培养一个聪明的模型,让它成为能干活的“智能实体”。

特朗普用中国威胁民众,忽视数据中心问题的根源
特朗普用中国威胁民众,忽视数据中心问题的根源

保持冷静,避免情绪化反应,集中精力应对场上的挑战。...

[无下一篇]
[无下一篇]

保持冷静,避免情绪化反应,集中精力应对场上的挑战。...