是什么
L1 · 领域总览
算力与基础设施
算力与基础设施是 AI 系统的底座,决定训练效率、推理性能与服务可用性
为什么
学习该领域可帮助工程师与架构师高效选型、优化资源利用率,降低 AI 项目的算力成本与延迟。
怎么做
建议从计算硬件入手,再了解计算平台与服务设施,逐步构建完整的算力认知。
什么时候
在启动 AI 项目或面临算力瓶颈时优先学习;若仅做应用层开发,可后续按需了解。
FOCUS
下属主题
PROBLEM / POSITION / INTERFACE
先弄清它为什么存在,以及谁在使用
-
01 解决的问题
当 AI 项目需要大规模训练或低延迟推理时
缺乏基础设施知识会导致资源浪费、性能瓶颈与部署失败
- 成功标准
- 能够根据业务需求合理选型并高效调度算力资源
-
02 AI 生态位
位于 AI 系统底层,为模型训练与推理提供计算与存储支撑
- 上游
- 依赖半导体制造、网络通信与数据中心技术
- 下游
- 为模型训练、推理服务与 AI 应用提供算力保障
-
03 人的生态位
帮助工程师做出技术选型与架构决策
- 适合使用
- 需要构建或优化 AI 系统的底层算力架构时
- 不必使用
- 仅做轻量级 AI 应用开发且无性能瓶颈时
-
04 独特价值
提供可扩展、高可用、低延迟的算力支撑,是 AI 系统落地的关键
硬件异构性、资源调度优化与成本控制是主要挑战
- 复杂度判断
- 复杂度不是功能数量,而是控制与验证成本。
INTERFACE FLOW
谁在操作,信息怎样流动
-
WHO OPERATES
HUMAN负责算力选型、架构设计与资源调度策略
SYSTEM自动执行任务调度、负载均衡与故障恢复
-
INPUT
模型训练任务、推理请求与数据流
-
CONTROL
硬件配置、调度策略、网络拓扑与监控参数
-
OUTPUT
计算结果、服务响应与资源使用报告
COMPARE
下属主题怎么区分
| 维度 | 计算硬件 | 计算平台 | 服务设施 |
|---|---|---|---|
| 核心问题 | 如何选型与优化 AI 加速芯片 | 如何高效调度与管理算力集群 | 如何部署与保障模型服务可用性 |
| 关注层级 | 芯片与板卡级 | 集群与系统级 | 服务与应用级 |
| 典型技术 | GPU 架构、内存带宽、互联技术 | Kubernetes、Slurm、资源调度算法 | 模型服务框架、负载均衡、弹性扩缩容 |