返回作品列表

从 Jarvis 到「路由」——我对 Agent 的理解

我本想做一个像 Jarvis 一样的全能管家。试遍了市面上几乎所有模型当「脑子」之后,我想明白了:现阶段的 Agent 不是全知全能的助理,而是一个在具体场景里解决具体问题的「路由」。这是我每天真实在跑的三层架构,以及它教会我的事。

类型
个人 AI 实践与思考
周期
2026 — 持续探索中
团队
个人探索
成果
每日在用 · 仍在打磨
技术栈
OpenClaw(移动端入口)+ 共享本地 vault + Claude Code(Codex 辅助)
我的角色
探索者搭建者重度用户
一、

背景(Why)——一套全靠手动维护的工作流

这不是一个创业故事。背景很简单:我回国之后有一段时间在专门研究 AI,手里攒了一批真实的个人需求,想看看能不能用 AI 把它们接管下来——体重控制、健康管理、简历投递、AI 学习、做简历,都是我每天真在做的事。

Agent 之前

三个工具,全靠手动

在 Agent 时代之前,我的工作流是三件套各管一摊:

工具角色我手动做的事
Notion主系统 · 规划管理每天手动维护那张大板
滴答清单To-Do List每天手动维护待办
Flomo碎片知识收集随手把想法、知识一条条录进去
这套东西本身没问题,问题在于全是手工活:板要自己维护、碎片要自己录、todo 要自己排。维护成本一上来,系统就会慢慢荒掉。
二、

第一次尝试:想做一个 Jarvis

Agent 时代来的时候,我是那种愿意试、想跟上、想拿新工具提效的人。一个很自然的念头是:能不能用 Agent 把上面那套手动工作流整个接管掉,做一个像钢铁侠那个 Jarvis 一样的全能管家——我说一句,后面的事它全办了。

2026 年初 OpenClaw 上市了——因为它的 logo 长得像只龙虾,国内大家都叫它「龙虾」🦞。我在它上面配了一个属于自己的 Agent,取名 Nova,就拿 Nova 来试这个想法。那段时间我几乎每天都在研究新的 Skill 装到 Nova 上、每天用,目标很明确:把它做成我的全职助理。

碰壁

先以为是脑子不行,于是试遍了模型

现实是,它干得并不好。一开始我以为是脑子不够强,于是几乎把能当「脑子」的模型试了个遍:国内从 DeepSeek、智谱 GLM 换到 MiniMax,国外再到 Gemini、Claude。

换下来有两个结论。第一,模型确实影响很大,好脑子和差脑子的差距是真实的;第二,好模型也真贵,不是堆最贵的就一定划算。(光是「给 Nova 挑脑子」这件事,后来单独长成了另一个项目——我的前沿模型横评。)

但最关键的发现不在模型本身:至少现阶段,Agent 做不到全知全能的 Jarvis。这不是换个更强的脑子就能解决的——是方向问题,不是马力问题。想通这一点,我才真正开始重新理解 Agent。
三、

那 Agent 到底是什么(我现在的理解)

这一段是我整个折腾下来最想说的部分。

结论一

别把 Agent 当 Jarvis

现阶段的 Agent 不是全知全能的 Jarvis。你越想让一个 Agent「什么都会」,它越容易出错、越容易幻觉。正确的用法是反过来:把 Agent 放进一个「具体场景」,让它解决这个场景里的「具体问题」。道理也不玄——模型的幻觉在开放、宽泛的问题上最严重,把问题收进一个有知识库、有 SOP 的窄场景里,等于提前给它划好了护栏。

结论二

一个能干活的 Agent 怎么搭

我现在搭一个 Agent 的配方是三样东西:

要素作用
底层模型(脑子)决定推理和表达的下限,影响很大但不是全部
这个场景的知识库把它需要知道的事实喂给它,减少幻觉
从场景提炼的 SOP / 需求把「该怎么做」固定下来,降低出错率
脑子 + 场景知识库 + SOP,三样配齐,Agent 就能在这一个具体场景里,以更低的出错率和更少的幻觉,把具体问题办好。范围越收得住,它越靠谱。
结论三

合格的 Agent 更像一个「路由」

再往上抽象一层:现在一个合格的 Agent,更像一个路由。它真正解决的,是「传统 workflow 没法用自然语言交互」这个问题。

你用自然语言对 Agent 说话 ↓ Agent 做路由判断(这事该交给谁) ↓ 调用某个具体 Skill / 执行某个具体 Workflow ↓ 拿到结果,返还给 Agent ↓ Agent 像人一样,把结果讲给你听

说白了,这跟业界讲的 function calling / tool use 是一回事,只是我更习惯把它想成「路由」:以前的 workflow 能干活但不会说话,你得按它的规矩点按钮;现在 Agent 补上了「用自然语言进、用自然语言出」这一层。中间真正干活的,还是那些被定义好的具体 Skill 和 Workflow。

四、

我现在怎么用(真实在跑的三层架构)

想明白「别让一个 Agent 什么都干」之后,我就改了打法:把主力工作重心切回 Claude Code(复杂任务和代码),Codex 在旁边打辅助;Nova 不再硬撑全能助理,退回它真正擅长的位置——一个从手机端下达指令、记录信息的入口。

整套系统拆成三层,关键是三层共用同一份底层 vault——这是它们能协同的前提。

第一层 · 入口

Nova(我跑在 OpenClaw / 龙虾 上的 Agent)

  • 主要在手机端,让我随时随地下达指令、记录信息
  • 做的是记录类的活:每日事项提醒、提醒哪件还没做、记录今天要做的事、记录想法、记录知识、记录身体数据
  • 遇到它办不了的复杂任务,就把任务丢进 Inbox 文件夹,交给上层
第二层 · 共享底座

所有 Agent 共用的同一份本地知识库 / 记忆(vault)

  • 手机端记录的信息和指令,都进入这份共享记忆
  • 它是唯一信息源,谁要用就从这里读,谁有更新就往这里写
  • 正因为底座是同一个,上下两层才能对得上、接得住
第三层 · 复杂任务处理

Claude Code

  • 每天扫描 Inbox 文件夹,发现该它处理的复杂任务就执行
  • 复杂任务 / 代码 / 决策性的活归它,Codex 在旁边打辅助
  • 处理完写回 vault,闭环回到共享底座
Nova(手机入口) ↓ 记录类直接处理 / 复杂任务写进 Inbox 共享 vault(同一份底层记忆) ↓ 信息与指令的唯一信息源 Claude Code(每天扫描 Inbox) ↓ 处理复杂任务,结果写回 vault

这套东西没有一个「全能脑」,每一层只做自己擅长的事,靠同一个 vault 串起来。它不漂亮,但每天真在用——这恰恰是前面那个结论的落地:不追求一个 Jarvis,而是让每一层都待在自己能干好的那个窄场景里。

五、

从理解到落地:数字分身 Chatbot

顺着「场景化」这个思路,我用 Dify 给这个作品集网站做了一个 Chatbot——一个以我的简历和项目为知识库的「数字分身」,访客想了解我的时候,可以直接和它对话,而不用一页页翻。

它就是上面那套理解的直接落地:一个具体场景(回答关于我的问题)、一份场景知识库(简历 + 项目经历)、一组 SOP(该怎么答、什么不该答)——脑子 + 场景知识库 + SOP,缺一不可。

👉 它已经上线了——点击页面右下角的聊天气泡,直接和「AI 版的我」聊聊。
返回所有作品