L2 · 主题中枢

视觉模型:从像素到语义的理解引擎

视觉模型图像分类目标检测图像分割CV

视觉模型不是单一技术,而是三类空间理解范式的协同基座。

3核心任务范式
2主流骨干架构
先记住分类回答‘是什么’,检测回答‘在哪’,分割回答‘边界在哪’。

三者输入相同,但输出结构、评估指标与工程约束截然不同;混用会导致接口错配与性能坍塌。

LIVE
CORE 视觉理解
01 WHAT

是什么

视觉模型是一类专为处理图像数据而设计的深度学习模型,核心任务是将原始像素映射为结构化语义输出。

02 WHY

为什么

解决机器‘看懂’图像的问题——识别内容、定位对象、划分区域,支撑自动驾驶、医疗影像、工业质检等真实场景。

03 HOW

怎么做

根据任务类型选择对应子方向(分类/检测/分割),明确输入图像约束、标注要求与输出格式,再选型适配的骨干网络与训练范式。

04 WHEN

什么时候

任务需空间定位(不止‘是什么’,还要‘在哪’)或像素级操作(如手术导航、电路板焊点修复)时必须使用。不宜时:仅需粗粒度图像筛选(如‘是否为证件照’)、固定模板匹配(OCR前预处理)或人工可100%覆盖的简单规则场景,应避免引入视觉模型复杂度。

THIS PAGE INCLUDES
图像分类目标检测图像分割

FOCUS

下属主题

点进去继续学

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 独特价值

分工明确,不可降维替代

分类无法定位目标;检测无法表达连续区域;分割计算开销大且不适用于稀疏对象。三者共存是精度、效率与任务适配性的最优解。

02 复杂度

最难的是跨任务一致性

同一图像经分类/检测/分割模型输出应逻辑自洽(如检测框内类别与分割掩码一致);不一致即暴露数据偏差或模型耦合缺陷。

03 使用判断

按输出需求选择,而非按流行度

若业务只需‘图中是否有猫’→用分类;需‘猫在左上角’→用检测;需‘精确描出猫的毛发轮廓’→用分割;混合需求则需Pipeline编排。

ROUTE

学习路径

建议按此顺序逐步深入
01
起点:理解三类输出格式差异

掌握ImageNet标签、COCO bbox JSON、COCO RLE mask三种标准输出结构及其验证方式。

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    当系统需从图像中提取可操作语义(如‘图中是否有缺陷’‘病灶位于何处’‘道路边界在哪’)时触发。

    仅靠规则或传统CV无法泛化;端到端黑盒模型输出不可解释、难调试、边界模糊,导致误判无追溯路径。

    成功标准
    给定一张图像,模型稳定输出符合业务定义的结构化结果(类别标签、带坐标的框、像素级掩码),且错误可归因到数据、标注或架构层面。
  2. 02 AI 生态位

    位于AI栈感知层,上承多模态融合(如VLM),下接特征提取器(CNN/Transformer骨干)与任务头;不直接生成动作,但为决策提供空间-语义基础。

    上游
    依赖高质量图像采集管线、标准化预处理(尺寸/归一化/增强)及领域适配的标注规范。
    下游
    为视觉语言模型(VLM)、机器人导航、AR交互、工业自动化控制系统提供结构化视觉理解输入。
  3. 03 人的生态位

    算法工程师负责任务对齐与评估标准设定;数据工程师保障图像质量与标注一致性;领域专家定义‘什么是正确结果’。

    适合使用
    任务需空间定位(不止‘是什么’,还要‘在哪’)或像素级操作(如手术导航、电路板焊点修复)时必须使用。
    不必使用
    仅需粗粒度图像筛选(如‘是否为证件照’)、固定模板匹配(OCR前预处理)或人工可100%覆盖的简单规则场景,应避免引入视觉模型复杂度。
  4. 04 独特价值

    在像素级空间精度与语义粒度间取得不可替代平衡——分类提供全局意图,检测定位关键实体,分割刻画精细轮廓;三者组合构成完整视觉理解闭环。

    真正难点在于跨尺度特征对齐(小目标漏检)、长尾类别泛化(罕见缺陷识别)、标注噪声鲁棒性(医学图像边界模糊)、以及部署时精度-延迟-功耗的三角权衡。

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN定义任务边界、验收标准与失败容忍度

    BACKEND执行推理调度、后处理(NMS、mask refinement)与结果校验

  2. INPUT

    RGB图像(通常为固定分辨率张量),可能含元数据(拍摄设备、时间戳、地理坐标)。

  3. CONTROL

    输入分辨率约束、置信度阈值、IoU阈值、类别映射表、后处理参数(如mask最小面积过滤)、硬件加速策略(TensorRT优化配置)。

  4. OUTPUT

    结构化JSON或二进制掩码,交付给下游服务(如告警系统、UI渲染器、VLM上下文注入模块);不直接产生外部副作用,但错误输出会引发连锁决策风险。

FLOW

一次工业质检流程

01图像采集产线相机捕获PCB板图像,自动白平衡与畸变校正
02分类初筛快速判断是否存在明显缺陷(如缺件、短路)
03检测定位对初筛阳性图像定位缺陷坐标,供机械臂复检
04分割精修对关键缺陷区域做像素级分割,量化腐蚀面积

COMPARE

三类任务的核心差异

维度图像分类目标检测图像分割
输出粒度图像级实例级像素级
典型标注类别标签边界框+类别像素掩码+类别
推理延迟最低(<10ms)中等(20–50ms)最高(>100ms)
数据成本低(单标签)中(框标注)高(精细掩码)

PRACTICE

选型与落地最小清单

确认业务输出需求(标签/框/掩码)
测量图像采集链路的分辨率与噪声水平
验证标注工具能否支持目标格式(如COCO JSON或RLE)
测试骨干网络在边缘设备上的吞吐量(FPS)与内存占用
为每类任务定义独立的评估指标与失败阈值

FAQ

常见问题

选型、用法与失败,不复述定义。
01谁在实际调用这些模型?

Backend服务封装API,人类只参与任务定义与结果验收。

决定接口设计(REST/gRPC)、错误码体系(数据问题 vs 模型问题)和监控粒度(per-image latency vs batch throughput)。
02图像分类和目标检测的根本区别是什么?

分类假设图像只含一个主体,检测必须处理多目标、遮挡与尺度变化。

影响数据增强策略(分类可用裁剪,检测需保持bbox完整性)和损失函数选择(分类用CE,检测用GIoU+分类Loss)。
03最小可用的图像分割方案是什么?

使用Segment Anything Model(SAM)零样本分割+规则后处理(面积过滤、连通域合并)。

避免从零训练,但需注意SAM对细粒度纹理(如电路走线)分割不稳定,需人工校验。
04生产中最常见的失败信号是什么?

检测框大量漂移(IoU骤降)、分割掩码出现离散噪点、分类置信度分布偏移(如正常图置信度普遍<0.6)。

指向不同根因:漂移→标注偏差;噪点→后处理参数不当;置信度偏移→图像采集退化或概念漂移。
05什么时候该用传统CV而不是深度学习?

当图像背景恒定、目标形态规则、光照可控且实时性要求极高(<1ms)时,OpenCV模板匹配更可靠。

避免为简单问题引入模型维护、GPU依赖与数据漂移风险。