作者: Kelvin @ai_Goge

如果你最近开始研究 AI Agent,大概率会遇到一个很现实的问题:不是没有东西学,而是东西实在太多了。
Claude Code、Codex、OpenCode、Gemini CLI、MCP、Skills、RAG、Memory、Multi-Agent、Computer Use、Browser Use……今天刚弄明白 MCP,明天又看到 Skills;刚学会 Claude Code,又有人告诉你应该研究 Multi-Agent。最后收藏了几百个 GitHub 项目,却始终不知道自己到底应该先学哪个。
它把 AI Agent 庞大的知识体系整理成一张可以真正照着走的学习地图。目前项目已经整理了 240+ AI / Agent 项目、77 个 MCP / Skill、23 个基础动手练习,整个体系划分为 8 个主要阶段、2 条核心学习路线。
更重要的是,它先让你搞清楚一个关键问题:你到底是想把 Agent 用好(Track A),还是想自己开发 Agent(Track B)?
很多人第一次学习 Agent,最大的问题就是一上来开始安装各种框架。其实第一步应该先把 Agent 最基本的工作逻辑搞明白。
传统 ChatGPT 的工作方式是:你提问 → AI 回答。比如你问“帮我分析一下英伟达最近的投资价值”,AI 根据当前上下文、已有知识给出单次静态回答。
而 Agent 面对一个任务时,不只是生成一次答案,而是围绕目标连续完成多个步骤:
理解任务 → 拆解任务 → 调用工具 → 获取数据 → 分析结果 → 判断下一步 → 继续执行 → 最终交付。

核心逻辑:LLM 是大脑,而 Agent 是大脑 + 工具 + 工作流程 + 执行环境
这张学习地图最有价值的地方之一,就是把 Agent 学习过程拆成了有序阶段,避免跳级带来的巨大挫败感:
如果 Python 还不会、API 是什么还不知道、JSON 也看不懂,就直接开始研究 AutoGen、CrewAI、LangGraph 和 Multi-Agent,一定会非常痛苦。

Track A: CLI Power User(用好现成 Agent) vs Track B: Agent Builder(系统与架构开发者)
你并不想成为 Agent 工程师,也没有必要从零开发一套 Agent。你真正想做的是:让 Claude Code、Codex、OpenCode、Gemini CLI 这些现成 Agent 帮自己干活。
写代码、做网站、写文章、分析资料、处理 Excel、做研究、自动整理文件、调用浏览器、连接 GitHub、处理自己的知识库……走 Track A(约 8~10 周) 即可。
知道终端是什么,了解 cd、ls、mkdir、git clone 大概是干什么的,看到命令不陌生。
理解 Repository、Clone、Commit、Push、Branch。绝大部分 Skill、MCP 与开源 Agent 均托管在 GitHub。
理解 API Key、Endpoint、Request、Response、Token。Agent 调搜索服务、MCP 调外部系统本质都是 API。
看懂键值对格式(Key-Value),在配置 MCP、Agent 规则与数据交换时能快速修改参数。
重点理解 Token、Context Window。进入 Agent 时代后,Prompt 不是追求一句“绝世神咒”,而是考虑 四要素体系:任务、Context、Constraints(边界约束)与 Output(交付规范)。

四层架构体系:基础模型 (大脑) ➔ MCP (桥梁) ➔ Skills (SOP工作方法) ➔ 执行环境 (双手)
当你选定一个 CLI Agent(如 Claude Code 或 Codex)后,不要天天比对,而是连续使用一周,建立属于自己的项目工作流:
标准化连接 GitHub、Google Drive、数据库、浏览器或企业内部系统。初学阶段亲手连接 1~2 个刚需服务即可。
将股票分析、长文排版、发票整理等复杂操作固化为 SOP,无需每次重复输入几十行提示词。
如果你的目标是自己开发 Agent 产品或者复杂架构,那么需要进入 Track B:

按节奏稳步推进:从基础补齐到真实项目闭环交付
将现有工具深度融入日常工作。
利用 MCP/Skills 组装专属系统。
自研框架、Tool Use 与多智能体架构。
作者简介:Kelvin (@ai_Goge),长期专注 AI Agent 实战指南与学习路线。