什么是 AI Agent

最后更新:2026-09-20

AI Agent 是能自己动手做事的 AI。你给它一个目标,它不只是回答你,而是去执行——读文件、跑命令、调接口、查网页,做完一步看结果,再决定下一步。

聊天机器人也能把一件事说得很清楚,但它说完就停了。你要它改一个配置文件,它会告诉你「你可以这样改」,然后你复制粘贴、保存、重启。Agent 直接改,然后告诉你改完了。

差别的根源:有没有循环

一次问答是这样的:

你的问题 → 模型 → 回答 → 结束

Agent 是这样的:

你的目标 → 模型想一步 → 执行 → 看结果 → 模型想下一步 → 执行 → …
                                                              ↓
                                                         达到目标 / 卡住

中间那个「看结果」是关键。模型发出的指令执行完会产生真实反馈——命令报错了、文件不存在、网页返回 404。这些反馈会回到模型手里,成为下一条指令的依据。所以它能自己纠正:路径写错了就换一个,接口超时就重试。

这个循环也叫「工具调用」:模型能调用的不只是对话,还有一整套函数,每个函数对应一个真实动作。

举个具体例子

同样是「把这个项目的依赖升级到最新版」:

步骤聊天机器人Agent
看现状告诉你去跑 npm outdated自己跑,读到有 12 个包过期
改文件给你一段 package.json 片段自己改,然后装依赖
处理报错你把报错贴回去,它再给一版看到版本冲突,自己回退那个包重试
验证提醒你「记得跑测试」跑测试,发现两处挂了,回去改

差别不在聪明程度,在于它有没有手。用的可能是同一个模型,一个只能说话,一个能动手。

它会出错,这是设计的一部分

Agent 犯错的方式和聊天机器人不同。聊天机器人说错话,你读出来就知道了。Agent 做错事,是它真的把文件删了、把分支推了、把接口调了。

常见的错误有三类:

所以现在的 Agent 工具基本都带一个停下来问你的机制。有的叫审批,有的叫沙箱,有的叫计划模式——名字不同,作用一样:在执行真正有后果的动作之前,让人类看一眼

为什么现在才出现

这个想法本身不新,早期也有过。真正让它能用的是两件事凑到了一起:模型能稳定地按格式输出结构化指令,以及上下文窗口大到能装下整个任务的来回过程。缺任何一条,循环都跑不满三圈就崩了。

怎么开始用

大多数 Agent 是命令行程序——Claude Code、Codex CLI 这类,装好后在终端里说话。它们各自独立,你想同时用几个,就得开几个终端窗口分别照看。

Aiglade 解决的是这一层:把这些命令行 Agent 收进同一个桌面窗口,统一派任务、排队、过审批。Agent 本身还是原来那些,只是不用你来回切窗口盯着了。

还不确定自己需不需要 Agent,可以先看下一篇:Agent 和 ChatGPT 有什么不同