L3 · 专题文章

AI 应用架构

架构设计模型集成AI 工程

本页只讲 4 条最关键判断,不写百科

4核心点
先记住架构的核心是解耦与可观测

没有路由与监控的模型调用,迟早变成线上事故。

LIVE
CORE AI 应用架构
01 WHAT

是什么

将大模型能力封装为可复用、可观测、可治理的服务层,支撑上层业务逻辑。

02 WHY

为什么

业务开发者需要稳定调用模型、控制成本与风险,避免直接裸调 API 导致不可控。

03 HOW

怎么做

通过网关路由、上下文管理、输出校验与监控四步搭建最小可用架构。

04 WHEN

什么时候

当模型调用频率高、需多模型切换、或涉及敏感数据与合规要求时必须引入;单点实验或低频调用可直接用 SDK。

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 网关路由

不掌握就无法控制成本与可用性

必须支持按业务优先级、模型配额、延迟阈值自动切换,否则单点故障直接拖垮服务。

02 上下文管理

决定体验与成本的核心杠杆

需实现摘要压缩、历史截断、关键信息保留策略,否则 Token 费用失控且响应变慢。

03 输出校验

最高频踩坑:幻觉与格式错误

必须用 JSON Schema 或正则强校验,失败时重试或降级,否则下游解析崩溃。

04 可观测性

没有指标就无法调优与排错

必须记录每次调用的模型、延迟、Token、状态码,否则无法定位性能瓶颈或成本异常。

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    业务系统需要频繁调用大模型,且对延迟、成本、安全有明确要求。

    裸调 API 导致密钥泄露、响应不稳定、无法追踪调用链、难以做 A/B 测试。

    成功标准
    模型调用可路由、可观测、可回滚,业务代码与模型细节解耦。
  2. 02 AI 生态位

    位于业务逻辑与模型 API 之间,承担路由、缓存、上下文组装、输出过滤等职责。

    上游
    依赖模型 API、向量库、业务数据库、身份认证系统。
    下游
    为前端、后端服务、Agent 流程提供标准化模型能力。
  3. 03 人的生态位

    架构师定义策略,开发者实现组件,运维监控指标。

    适合使用
    多业务线共享模型、需合规审计、要求高可用或成本优化。
    不必使用
    单次实验、内部工具原型、无安全/成本约束的轻量场景。
  4. 04 独特价值

    将模型调用从“黑盒脚本”升级为“可治理服务”,支持灰度、降级与审计。

    上下文窗口管理、多模型路由一致性、输出格式强校验、成本与延迟权衡。

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN设定路由策略、审核 Prompt、验收输出质量

    SYSTEM执行请求转发、上下文拼接、缓存命中、指标上报

  2. INPUT

    用户请求、会话历史、业务上下文、配置参数。

  3. CONTROL

    模型路由规则、Prompt 模板、温度/TopP、最大 Token、输出 Schema、权限策略。

  4. OUTPUT

    结构化响应或文本,附带调用元数据(模型名、延迟、Token 消耗、状态码)。

CODE / PYTHON最小 Python 调用
import os
from openai import OpenAI
import json

client = OpenAI(api_key=os.environ["API_KEY"])

response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[{"role": "user", "content": "用 JSON 返回:姓名、年龄、职业"}],
    response_format={"type": "json_object"},
    temperature=0.2,
)

result = json.loads(response.choices[0].message.content)
print(result)

最短闭环:读环境变量密钥 → 调用 → 强制 JSON 输出 → 解析打印。真实密钥不要写进代码。

JSON / RESPONSE典型返回(示意)
{
  "id": "chatcmpl-9XyZ",
  "object": "chat.completion",
  "created": 1718000000,
  "model": "gpt-4o-mini-2024-07-18",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "{\"name\": \"张三\", \"age\": 28, \"profession\": \"软件工程师\"}"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 24,
    "completion_tokens": 15,
    "total_tokens": 39
  }
}

PRACTICE

上线前必查

是否配置了模型降级策略(如主模型超时切备用)?
上下文是否设置最大 Token 限制与截断规则?
输出是否通过 Schema 校验,失败是否有重试或兜底?
是否记录每次调用的延迟、Token 消耗与错误码?
敏感数据是否脱敏或本地化处理?

FAQ

常见问题

选型、用法与失败,不复述定义。
01它和直接调用模型 API 有什么区别?

架构层提供路由、上下文控制、输出校验与监控,裸调 API 仅完成单次请求。

避免将业务逻辑与模型细节耦合,提升可维护性与稳定性。
02最小可用方式是什么?

网关路由 + 上下文截断 + JSON 校验 + 基础日志,四步即可上线。

帮助团队快速验证架构价值,避免过度设计。
03什么时候不需要它?

单次实验、低频调用、无安全/成本约束的轻量场景。

控制系统成本,防止架构复杂度反噬开发效率。
04输出格式校验失败怎么办?

设置重试次数,失败后返回兜底响应或触发人工审核。

防止下游系统因格式错误崩溃,保障服务可用性。

NEXT

下一步

模型 API 接入