返回笔记
LLM
Agent 架构设计:让 LLM 自己思考和行动
Agent
ReAct
Function Calling
AutoGPT
LangChain
AI Agent 是 2024-2025 年最火的方向之一。它让大模型从"回答问题"进化到"自主完成任务"。
什么是 Agent
Agent 不是一种新模型,而是一种架构模式。它把 LLM 当作"大脑",配上:
- 工具:搜索、计算器、代码执行器、API 调用等
- 记忆:短期记忆(对话历史)、长期记忆(向量数据库)
- 规划:任务拆解、路径选择、自我反思
ReAct 模式
最经典的 Agent 范式。模型在每一步做两件事:
- Reason(推理):分析当前状态,决定下一步做什么
- Act(行动):调用工具执行具体操作
然后根据观察结果继续推理,形成 Thought → Action → Observation 的循环。
工具调用
最直接的方式是 Function Calling。OpenAI、Anthropic 等 API 都支持让模型输出结构化的函数调用请求。你把函数的 JSON Schema 传给模型,模型决定调用哪个函数、传什么参数。
多 Agent 协作
复杂任务可以由多个专门的 Agent 协作完成:
- Planner Agent:分解任务、分配子任务
- Coder Agent:专门写代码
- Reviewer Agent:审查代码质量
- Researcher Agent:搜索和总结信息
框架方面可以考虑 AutoGen、CrewAI、LangGraph 等。
Agent 的难点
- 幻觉放大:每一步出错都会在链条中放大
- 无限循环:模型可能陷入重复思考
- 成本控制:每次思考都消耗 token,深度思考代价高
- 安全:Agent 有执行权限,必须严格限制