注意:模型迭代非常快,此文具有时效性
9月更新:
gpt 6-astra:人上人。贵,太贵了,用不起。全能模型,各方面感觉不到短板,找bug能力极强,中文表达顺畅。如果打5折可以给到夯。
gpt 5.6-sol:npc。纯伪人,你跟他说『不要A』,他回答:好的,不要A,现在编写一个单测,拦截所有未来可能出现的A,并且在所有注释和文档里写上『一定不要出现A』。
glm5.3:夯。我的主力编码模型,指令遵循能力极强,在300k上下文范围内基本可以良好的完成实现,代码质量也很高。5.3为了完成任务会不择手段,某天晚上我让他帮我调试一个环境,他使用浑身解数,包括但不限于跳过root,偷我浏览器cookie,用工具把图像转成它可读的字符串等,最终完成了任务。但是glm5.3属于是后训练过头的模型,动不动就雷霆大思考,过度防御严重。
glm5.3-flash:人上人。这个flash很慢,不是真flash,干烂活能力很强,可以完整的推进方案,但是思考深度不足,代码质量很差。不过zcode晚上11点之后免费,无敌。
deepseek v4.1 flash:npc。快就完事了,别的你别管!公测当天晚上实测峰值达到300tokens/s,比我们在本地部署的模型都快,给我看傻了。实际做下来,可以干简单活,做日常agent任务,编码还是一般,丢上下文问题严重,可能和非对称架构有关系。但是快就完事了。
grok 4.6:人上人。虽然实测没有跑分那么强,但是在90%的一般问题上,展现了良好的工程能力,代码很干净,思路有点像gpt。缺点仍是思考深度不足,搞不定复杂场景。
hy4-preview:夯(纯粹是个人偏好)。这个模型一看就是后训练没训好,不会雷霆大思考,很多工具调用也不能一遍对,反而在体感上有了opus4.6的感觉:方案不过度,工程实现也比较克制,干不出来也不会硬干,虽需要人工提醒,但是和他交流非常舒服。希望后续正式版保持这种状态。
8月更新:
ds v4 flash 0731(with opencode): 夯爆了。思考深度,安全对齐和coding能力都有非常大的提升。但是仅限于干活,在方案设计和问题分析的广度与深度上仍弱于glm5.2。价格便宜速度快,完美的牛马干活模型。
qwen3.8(with qoder): NPC。没有展现出2.4T模型的智力,做的方案都奇奇怪怪的,复杂任务上甚至不如glm5.2。优点是多模态能力不错,文档流畅自然。
glm5.2(with opencode): 夯。打开max思考模式的情况下,使用omo的ulw-plan工作流,反复多次的打磨方案,消耗大量token,从结果上看基本可以做到opus4.8的水平,但是代码质量仍显著逊色于opus。缺点就是慢和冗余,一次思考的reasoning token可达32k以上。
opus 5(with cc):人上人。一如既往地精准,自然。无论什么困难的问题,不管你想没想清楚,丢给opus老师,他都能给你一个看着非常好的方案。缺点就是又贵又慢,用不起。
sonnet 5(with cc): 拉完了。评价为不如glm5.2。你这个价格我为什么不用glm?
minimax m3(with opencode): 拉完了。幻觉太多,思考深度也不行,干活流口水。
kimi k2.6(with qoder): 人上人。依靠过度思考可以得到不错的结果,多模态好评。
ds v4 pro(with opencode): 拉完了。幻觉太多,干活各种糊弄,不遵从指令,比glm5.2还要贵,期待正式版吧。