返回笔记
LLM

Agent 架构设计:让 LLM 自己思考和行动

Agent ReAct Function Calling AutoGPT LangChain

AI Agent 是 2024-2025 年最火的方向之一。它让大模型从"回答问题"进化到"自主完成任务"。

什么是 Agent

Agent 不是一种新模型,而是一种架构模式。它把 LLM 当作"大脑",配上:

  • 工具:搜索、计算器、代码执行器、API 调用等
  • 记忆:短期记忆(对话历史)、长期记忆(向量数据库)
  • 规划:任务拆解、路径选择、自我反思

ReAct 模式

最经典的 Agent 范式。模型在每一步做两件事:

  1. Reason(推理):分析当前状态,决定下一步做什么
  2. Act(行动):调用工具执行具体操作

然后根据观察结果继续推理,形成 Thought → Action → Observation 的循环。

工具调用

最直接的方式是 Function Calling。OpenAI、Anthropic 等 API 都支持让模型输出结构化的函数调用请求。你把函数的 JSON Schema 传给模型,模型决定调用哪个函数、传什么参数。

多 Agent 协作

复杂任务可以由多个专门的 Agent 协作完成:

  • Planner Agent:分解任务、分配子任务
  • Coder Agent:专门写代码
  • Reviewer Agent:审查代码质量
  • Researcher Agent:搜索和总结信息

框架方面可以考虑 AutoGen、CrewAI、LangGraph 等。

Agent 的难点

  • 幻觉放大:每一步出错都会在链条中放大
  • 无限循环:模型可能陷入重复思考
  • 成本控制:每次思考都消耗 token,深度思考代价高
  • 安全:Agent 有执行权限,必须严格限制