是什么
L1 · 领域总览
模型体系:AI 能力的底层基座全景图
模型不是黑盒,而是可编排的能力原子 —— 四大范式定义了 AI 的输入、输出与认知边界。
4核心范式
∞组合可能
关键认知范式 ≠ 模型数量,而是能力维度划分
语言模型处理符号逻辑,视觉模型处理空间感知,生成模型建模分布变换,语音模型处理时序信号 —— 它们不可互换,但可协同。
LIVE
CORE
Model Systems
为什么
为上层应用(如 Agent、RAG、工具链)提供可组合、可替换、可评估的原子能力单元。
怎么做
从任务所需输入/输出模态出发,选择对应模型范式,并明确其在系统中的调用位置与能力边界。
什么时候
任务涉及多模态输入/输出、需动态切换能力、要求模块化演进或需独立评估各能力单元时。不宜时:单一模态、固定流程、低延迟硬实时场景(如工业控制),或可用规则引擎、传统 CV/NLP 模型解决时。
FOCUS
下属主题
模态路由器
根据输入类型分发至对应模型范式
语言模型
处理文本理解与生成
视觉模型
处理图像识别与描述
跨模态融合器
对齐多源表征,生成联合推理结果
PROBLEM / POSITION / INTERFACE
先弄清它为什么存在,以及谁在使用
-
01 解决的问题
当构建多模态应用或需要跨任务复用能力时,无法判断该选用哪种模型类型或如何组合。
盲目堆叠模型导致冗余推理、模态错配、延迟不可控、成本失控,且难以定位失败环节。
- 成功标准
- 能根据业务输入(文本/图像/语音/结构化数据)和期望输出(生成/识别/转换/决策)精准匹配模型范式,并定义清晰的接口契约。
-
02 AI 生态位
位于 AI 栈最底层基础设施层,向上支撑推理引擎、Agent 框架与应用层;向下依赖算力、数据与训练框架。
- 上游
- 高质量标注数据、统一特征表示、硬件加速支持(如 FlashAttention、vLLM)、标准化模型格式(GGUF、ONNX、Safetensors)。
- 下游
- 为 RAG 检索器、Agent Planner、工具调用器、评估模块及前端交互层提供确定性能力输出。
-
03 人的生态位
架构师与系统工程师负责选型、集成与边界定义;领域专家负责验证输出语义合理性;运维人员负责监控性能与降级策略。
- 适合使用
- 任务涉及多模态输入/输出、需动态切换能力、要求模块化演进或需独立评估各能力单元时。
- 不必使用
- 单一模态、固定流程、低延迟硬实时场景(如工业控制),或可用规则引擎、传统 CV/NLP 模型解决时。
-
04 独特价值
提供正交能力切片——同一任务中可混合调用不同范式(如语音转文本 → 语言模型 → 文本转图像),而无需重训端到端模型。
真正困难在于模态对齐(如图文一致性)、跨范式性能归一化(延迟/吞吐/精度不可比)、以及无监督场景下能力边界模糊导致的误用。
- 复杂度判断
- 复杂度不是功能数量,而是控制与验证成本。
INTERFACE FLOW
谁在操作,信息怎样流动
-
WHO OPERATES
HUMAN定义任务模态需求、设定质量阈值、审批模型替换
BACKEND加载模型、封装 API、管理缓存与批处理
TOOL作为可插拔组件被调度,不参与决策但执行具体计算
-
INPUT
原始业务数据(如用户提问文本、上传图片、语音流、传感器信号)。
-
CONTROL
模态路由策略、精度/延迟/成本权衡参数、上下文长度限制、输出格式 Schema、安全过滤规则。
-
OUTPUT
结构化预测结果(分类标签、嵌入向量、生成 token 流、坐标框、音素序列),交付给下游模块消费,不直接产生外部副作用。
COMPARE
四大范式的核心对比
| 维度 | 语言模型 | 视觉模型 | 生成模型 | 语音模型 |
|---|---|---|---|---|
| 输入模态 | 文本序列 | 图像/视频 | 噪声/条件/参考 | 音频波形 |
| 输出目标 | 符号响应 | 空间标注 | 新样本生成 | 文本/音素/属性 |
| 评估重点 | 事实性、逻辑性、流畅性 | 准确率、召回率、IoU | 保真度、多样性、可控性 | WER、MOS、说话人一致性 |
| 典型失败信号 | 幻觉、逻辑断裂、格式错误 | 漏检、错检、定位偏移 | 模式崩溃、语义失真、版权风险 | 断字、静音、口音误识 |