一份持续更新的实测记录:把 Claude / GPT / Gemini / DeepSeek / MiniMax / 智谱 GLM 的底层模型,以及各家自己的 chatbot / Agent 产品都用过一遍,目的是给我跑在 OpenClaw(logo 像龙虾、国内都叫它龙虾)上的 Agent —— Nova 找最合适的「脑子」,并搞清楚不同场景该用哪个脑子。不是排行榜,是一份还在写的使用日记。
我做这件事最开始的动机很实际:OpenClaw(logo 像龙虾、国内都叫它龙虾)上跑着我的 Agent —— Nova,我得给 Nova 接一个底层模型当「脑子」。 但不同任务对脑子的要求不一样,所以我开始一个一个去试每个模型的边界——到底哪个脑子最合适,以及不同场景下该换哪个脑子。
试着试着就铺开了。我不只测底层模型,也大量用各家自己的 Agent / Chatbot 产品: Gemini 的 chatbot、Claude 的 chatbot / Claude Code / Co-worker、OpenAI 的 ChatGPT / GPT Image / Sora 2、 Grok、DeepSeek、MiniMax(多模态)、智谱 GLM。这份东西就慢慢长成了一份选型笔记。
我关心的不是跑分,而是真正影响我「这件事用谁」的几个维度:
| 维度 | 我在意什么 |
|---|---|
| 上下文能力 | 能不能一次吃下长文档 / 大代码库,关键信息记得住 |
| 多模态能力 | 图片、PDF、音视频理解得怎么样 |
| 任务成本 | 完成一个任务实际花多少(订阅 Plan + token 用量两头看) |
| 复杂任务处理 | 硬骨头任务的完成度和逻辑严密程度 |
| 回复速度 | 日常交互的体感快慢 |
| 具体生成场景 | 图片生成 / 视频生成 / 语音生成 / 文本生成各自的能力 |
我经常直接用各家自己的 Agent / Chatbot 产品,而且是随机切换:遇到一个任务, 我会同时让 4~5 个不同家的 Agent 一起跑,把结果摆在一起对比。 这种比法不严谨,但它贴近我真实的使用方式。
这些模型基本都接进过 OpenClaw、给 Nova 当脑子整体体验过一段时间——不是只在 chatbot 里聊两句, 而是真的挂上去当调用层的脑子用过,所以对它们当「Agent 底座」时的脾气有体感。
成本对比我分两头:一头看各家的订阅 Plan划不划算, 一头看token 的实际用量。每个我都用过一段时间,花了多少心里有数, 所以不是拍脑袋,但也没做成精确的电子表格。
下面是我和每个模型的真实使用历史,按我用得多到少大致排。版本号和时间线参考公开资料补全, 和我个人体感冲突的地方我会标出来。
我从 Claude 3.5 一路用到现在的 4.8(3.5 Sonnet 约 2024-06,4 系列约 2025-05, Opus 4.5 约 2025-11,4.8 约 2026-05)。Opus 系列在我手里是复杂任务的天花板, 硬骨头任务交给它最放心。这也是 Nova 主力调度层最后落在 Claude 的原因。
GPT 我用得最久,从最早的 GPT-3 一直用到现在的 GPT-5.5(GPT-4 约 2023-03, GPT-5 约 2025-08,5.5 约 2026-04)。它是均衡型选手, 我需要碰想法、聊思路的时候会找它。语音对话体验是我用过里最丝滑的。 它最新的 GPT Image 生图我觉得是目前最强的之一。
我从 Gemini 2.5(约 2025-03)开始接触,但真正大规模用是 Gemini 3(约 2025-11)之后。 它的 Nano Banana Pro 生图能力很强(约 2025-11-20 发布),有段时间我甚至全切到 Gemini。 另一个现实原因是:Gemini 在国外几家里价格相对便宜,所以很长一段时间我的 token 都走 Google。 它的长文本 / 超长上下文也很能打,前端开发能力很强。
我从 DeepSeek 很早的版本就开始用了。被广泛讨论「疑似蒸馏 OpenAI」的其实是 V3(约 2024-12 发布,当时有用户发现它偶尔自称 ChatGPT,随后 R1 约 2025-01 发布把讨论推到高峰)—— 补一句事实:DeepSeek 官方从未承认对主力模型做过蒸馏,这至今是业界质疑而非定论。 DeepSeek 最大的优点就是真便宜,文本推理也不错; 缺点是多模态做得不好,所以我用它的频次不如国外几家。
MiniMax 整体做得不错,我抢到过它的 Coding Plan,把它长期挂在 Nova 上用过一段时间, M2.5(约 2026-02)到 M2.7(约 2026-03)都用过。我觉得 M2.7 被低估了: 作为调用层的脑子,它回答有逻辑、清晰、不笨。它也是我多模态场景里会用的一家。
这一条我得诚实标注了解有限。GLM 我用得相对少, 据说 GLM-5.1(约 2026-03)很厉害,但我用下来觉得一般;它的 Coding Plan 很难抢、我没抢到, 只充了点钱做测试,所以谈不上深入了解。这里的判断仅供参考。