如何成为一名 Agent 工程师
约 1038 字大约 3 分钟
AIAgent职业发展
2026-07-03
Agent 工程师的核心工作是:让 LLM 从"一问一答的聊天机器人"变成"能自主规划、调用工具、多步执行任务的系统"。它介于传统后端工程和 AI 应用之间,重点不是训练模型,而是编排模型。本文梳理成为 Agent 工程师所需的语言、核心技能、工具框架与学习路径。
编程语言
- Python — 行业默认语言,绝大多数框架、论文复现、评测工具都以 Python 为第一公民。必学。
- TypeScript — 对前端出身的开发者是天然优势。Claude Agent SDK、OpenAI SDK、Vercel AI SDK、LangChain.js 都有完整的 TS 支持,很多 Agent 产品的前端交互(流式输出、工具调用可视化)本身就是前端活。完全可以以 TS 为主、Python 为辅切入。
- Go / Rust — 只在做高性能推理网关、基础设施时才需要,入门阶段不必碰。
核心技能
按重要程度排序:
1. LLM API 的深度使用
不只是发请求,而是理解 system prompt、多轮消息结构、streaming、structured output、function calling / tool use 的完整机制。这是一切的地基。
2. Context Engineering(上下文工程)
这是比 prompt engineering 更核心的技能:怎么管理有限的上下文窗口,什么信息放进去、什么摘要掉、什么存到外部记忆。Agent 跑得好不好,80% 取决于这个。
3. 工具设计(Tool Design)
给 Agent 设计好用的工具接口:
- 参数怎么定义才清晰无歧义
- 错误信息怎么返回才能让模型自我纠正
- 工具粒度多大合适
4. Agent 编排模式
- 单 Agent 循环(ReAct)
- 多 Agent 协作
- 规划-执行分离
- 人工审批节点(human-in-the-loop)
知道什么场景该用什么模式,以及什么时候不需要 Agent——很多任务用一条固定 workflow 就够了。
5. RAG 与记忆系统
向量检索、混合检索、长期记忆的读写策略。
6. 评测(Evals)
这是区分玩具和产品的分水岭:
- 给不确定性输出写测试
- 构建评测集
- LLM-as-judge
- 回归测试
7. 可观测性与调试
Agent 出错时看 trace 而不是猜。学会看每一步的输入输出、token 消耗、工具调用链。
工具与框架
SDK / 框架(选 1-2 个深入即可)
| 框架 | 说明 |
|---|---|
| Claude Agent SDK / OpenAI Agents SDK | 官方 SDK,理解 Agent 循环的最佳起点 |
| LangGraph | 目前生产环境最主流的编排框架(图结构、状态机、断点恢复) |
| Vercel AI SDK | 前端出身的话,这是最顺手的全栈方案 |
协议与标准
MCP(Model Context Protocol) — 连接 Agent 与外部工具的事实标准,必学。自己动手写一个 MCP server 是很好的入门项目。
配套设施
| 类别 | 工具 |
|---|---|
| 向量数据库 | pgvector(够用且简单)、Qdrant、Chroma |
| 可观测性 | LangSmith、Langfuse(开源) |
| 评测 | promptfoo、自建评测脚本 |
| 沙箱执行 | Docker、E2B(让 Agent 安全地跑代码) |
学习路径
- 第一周:用原生 API(不用框架)手写一个带 tool use 的 Agent 循环——while 循环 + 工具调用 + 结果回填。理解了这个,所有框架都只是语法糖。
// Agent 循环的本质(伪代码)
const messages = [{ role: 'user', content: task }];
while (true) {
const response = await llm.chat({ messages, tools });
if (response.toolCalls.length === 0) break; // 任务完成
for (const call of response.toolCalls) {
const result = await executeTool(call);
messages.push({ role: 'tool', content: result });
}
}第一个月:写一个自己的 MCP server(比如把个人知识库做成可检索的 MCP 工具),接入 Claude Code 实际使用。
之后:做一个完整的小产品(例如自动整理周刊摘录的 Agent),补上评测和 tracing,把"能跑"变成"可靠"。
关键认知
Agent 工程师最稀缺的能力不是会多少框架,而是判断力——知道任务边界在哪、模型什么时候会失败、怎么设计让失败可恢复。这只能通过大量实际构建获得,框架 API 反而是最不值钱的部分。
