七月中到八月初,不到三周时间,我数了一下,跟中国开源模型有关的事情一共有五件——三件已经发生,两件还是风声。
7 月 16 日,月之暗面发了 Kimi K3。我上一篇文章写过接进来的过程,当时折腾的是 usage 追踪和前缀成本,没顾上下"好不好用"的结论。7 月 19 日,阿里通义千问放出 Qwen 3.8 Max 预览版,8 月 3 日正式扩大开放。7 月 31 日,DeepSeek 把 V4 Flash 的正式版(GA)放出来,版本号 DeepSeek-V4-Flash-0731。这三个是已经发生的事。
往后看还有两个,都还没有官方公告,只是风声。智谱的 GLM-5.3,创始人唐杰 6 月底在 X 上问了一句"下一版 GLM 大家觉得必须要有什么新功能",8 月初官方文档又意外泄露了一小时。月之暗面的 Kimi K3.1,几家媒体说"目标 8 月发布"。
这段时间我自己也在动。Kimi K3 已经是我日常干活的主力,DeepSeek 我在改代码的时候常用,Qwen 3.8 昨天刚接进来还在测。相比之下,我原来的主力 Claude Code Opus 4.8/5,最近用着有点堵心。
这篇想把两件事分开讲清楚:这波发布里,哪些是真的、哪些还是传闻;以及我自己这几个月换用下来,实际的体感是什么样。
三个已经发生,两个还是传闻
先把时间线摆平,这是核实之后的版本。

| 模型 | 状态 | 时间 | 备注 |
|---|---|---|---|
| Kimi K3 | 已发布 | 2026-07-16 官宣,07-27 完整权重 | 2.8 万亿参数,100 万 token 上下文 |
| Qwen 3.8 Max | 预览转扩大开放 | 07-19 预览,08-03 扩大开放 | 尚未开源权重,目前只有 API |
| DeepSeek V4 Flash 正式版 | 已发布(GA) | 2026-07-31 | 版本号 V4-Flash-0731,MIT 协议 |
| GLM-5.3 | 传闻/泄露 | 无官方日期 | 智谱称"仍在训练中" |
| Kimi K3.1 | 传闻 | 据报道目标 8 月 | 月之暗面未官方确认 |
三点值得展开说。
第一,Qwen 3.8 Max 现在严格说还不是"开源模型"——阿里目前只开放了 API,开源权重"承诺下周",我核实的时候还没兑现,协议条款也没公布。放进"开源发布密集"这个框架里没问题,因为它确实是这波动作的一部分,但它眼下的开放程度跟已经放出权重的 K3、DeepSeek 不是一回事。
第二,GLM-5.3 和 Kimi K3.1 目前都停留在传闻阶段。智谱那次文档泄露,员工私下回应说模型"仍在训练中",对标目标是 Fable 级别——这是唯一比较接近官方的说法,但也不是公告。Kimi K3.1 更弱,只有几家媒体转述"内部人士",连月之暗面自己的博客、GitHub、X 账号都没提过这个名字。这两个我这次只能按传闻处理,不写成确认的事实。
第三,DeepSeek V4 Flash 这次的 GA 更新,官方 API 文档里只有一句版本提示——模型从预览版更新到了 DeepSeek-V4-Flash-0731,调用方式不变。规模和架构跟 4 月的预览版一样,是重新训练而不是换了个更大的模型,方向上主要针对 agent 能力(工具调用、改代码、多步任务)。这个方向和我自己"改代码效果惊艳"的体感,对得上。
Kimi K3 到底有没有那么强
7 月发布那两天,朋友圈和群里传的说法我在上一篇也提过:跑分全球第四,前端代码 Arena 第一,SWE Marathon 比 Fable 5 还高。这次我把这几条挨个核实了一遍。
"前端代码 Arena 第一":属实。Arena.ai(原 LMArena)的 Frontend Code Arena 榜单上,K3 首发即以 1,679 Elo 排第一,高于 Claude Fable 5 的 1,631、GPT-5.6 Sol xHigh 的 1,618,七个子类目赢了六个。
"SWE Marathon 比 Fable 5 还高":属实。SWE Marathon 是评测模型能不能持续干完一个长周期软件工程任务的一项基准,月之暗面自己放出的评测表里,K3 这一项 42.0 分,高于 Claude Opus 4.8 的 40.0、GPT-5.6 Sol 的 39.0、Claude Fable 5 的 35.0。我核对了两次官方数据,数字是一致的。
"跑分全球第四":这条最有意思,因为它是个移动靶。Artificial Analysis(一家专门做模型智能指数评测的机构)自己发文章的标题写的是"K3 达到智能指数第 3 名"——那是发布当周,K3 57 分,落后于 Fable 5 的 60 分、GPT-5.6 Sol 的 59 分。中文媒体当时报的是"第四",两个数字对不上的具体原因我没查清楚,可能是统计口径不同。但我这次去查实时榜单,K3 已经掉到第 7 名,因为 Claude Opus 5 在它之后发布,一下子占了好几个靠前的位置。"第 3"和"第 7"这两个排名都没说错,只是分别对应两个不同的时间点。跑分这东西本来就是这样,你截图的那一刻它是真的,过两周就成历史了。
有意思的是,月之暗面自己在博客里说得很老实,原话经 SCMP 引用是"整体表现仍落后于最强的专有模型",同时"持续超过其他被测模型"——它自己都没说自己是第一,是外面传的比官方自己说的更响。
权威媒体怎么看这波发布
这波发布不是我自己一厢情愿觉得密集,几家权威媒体也在同时报道。
SCMP 在 7 月 20 日的报道里引用了美国企业研究所(AEI)的 Ryan Fedasiuk,他说中美 AI 能力的差距"现在已经缩小到大约几周的时间",还说 K3 的表现"推翻了'中国模型落后美国六到八个月'这个传统认知"。TechCrunch 在 K3 发布当天的报道里提到,市场当时预期它"表现持平甚至超越 Anthropic 的 Opus 4.8",同一时间月之暗面完成了一轮估值 315 亿美元的融资。
SCMP 8 月 3 日的另一篇报道,把 Kimi K3 和 Qwen 3.8 Max 这两次发布放在一起,称为"第二次 DeepSeek 时刻——不过这次是一记组合拳"。这个说法我觉得挺准的:去年 DeepSeek 那次是单点爆破,这次是月之暗面、阿里、DeepSeek 三家在三周之内接连出手,密度确实不一样。
Bloomberg 有一篇观点文章的标题是《便宜的中国 AI 给 Anthropic 和 OpenAI 带来新威胁》,大意是如果拿"技术从业者的实际采用率"当输赢的标准,中国正在快速追赶,因为不少美国的创业公司为了省钱转向了更便宜的中国模型。这篇我没能抓到全文核对原话,只能确认标题和大意存在,具体措辞留个保留。
我自己的换用体验
上面这些是核实过的公开信息。下面是我自己这几个月用下来的感受——先说清楚,这是体感,不是我拿一套评测跑出来的数字。
Kimi K3 现在是我的主力。 干活不磨叽,比较稳。这跟我上一篇吐槽的接入问题是两回事——那篇讲的是我自己工具里 usage 追踪读不出来、前缀成本没管好,是我这边的工程问题,不是模型本身的表现。工程问题修完之后,这几周天天用下来,K3 给我的感觉就是省事:交代清楚要干什么,它就干,不绕弯子。
DeepSeek 便宜,改代码这块效果让我意外。 这次查完定价才发现便宜到什么程度——V4 Flash 正式版 output 价格是 $0.28/M,Kimi K3 是 $15/M,差了大概 50 倍。DeepSeek 这次 GA 更新官方说的方向就是往 agent 能力上训,改代码、多步任务这些,跟我自己的体感对得上。
Qwen 3.8 昨天刚接进来,还在测,先不下结论。 阿里 8 月 3 日刚扩大开放,我第二天就接进去试了。用得还不够久,这次先不评价,等测得差不多了再单独写。
Claude Code Opus 4.8/5,最近用着差强人意。 具体是这么几件事:
话比较多,经常绕一大圈才说到点子上,我得从一堆铺垫里把重点自己挑出来。
问完问题给了答案,它不一定照做。举个我自己遇到的例子:上次让它帮我把一个项目放到某个位置,我明确说了新建一个项目,结果它还是把东西放进了我当前正在用的项目里——这是我这次遇到的一个具体案例,不是说它每次都这样。
做事丢三落四。这是我自己的一个主观类比:如果让它做到十分,它顶多也就做到六分。
这几条加在一起,是我这段时间不想继续把它当主力的原因。但我没退订——真要说原因,是 Fable 5 还在。Fable 是 Anthropic 目前最强的那档模型,冲着它我暂时留着这个订阅,没有立刻转向别处。这不是说 Claude 不行,是说 Opus 这一档最近在我这儿的表现,撑不起"主力"这两个字了。
写在最后
这次把这波发布挨个核实下来,最意外的不是哪个模型跑分高,是"全球第几"这种说法有多不耐用。K3 发布当周是第 3,两周后是第 7,两个数字都没说谎,只是对应不同的时间切片,跑分这东西你截的那一刻是真的,过阵子就成历史照片了。
真正没变的,是我自己这几个月天天用出来的体感:K3 干活不啰嗦,DeepSeek 便宜又能打,Qwen 3.8 还得再看看,Opus 这一档确实不如从前了。
信源:Moonshot AI 官方博客、Kimi K3 GitHub 评测、Artificial Analysis、SCMP:Kimi K3 发布、SCMP:硅谷反应、SCMP:Qwen 3.8 Max、DeepSeek 官方定价文档、财新:DeepSeek V4 Flash GA、TechCrunch。