理解AI视觉:从图像分类到实例分割
在计算机视觉中,机器感知图像的复杂性从将整个图像理解为一个单一概念,发展到在单个像素级别进行分析。这些任务根据它们提供的详细程度进行分类。
图像分类
图像分类是最基本的任务。它涉及为整个图像分配一个单一标签。例如,如果你向AI展示一张狗的照片,模型只需输出“狗”这个标签。它告诉你图像中有什么,但不指定对象的位置或是否存在多个对象。这用于内容审核等场景,其中整个图像被标记为安全或不安全,或用于简单的分类系统,其中图像根据其内容分类到文件夹中。
目标检测
目标检测通过识别图像中的内容及其位置,进入更细粒度的级别。它不是仅仅标记整个图像,而是在特定对象周围绘制边界框,并为每个框分配标签。例如,在街道场景中,它可能围绕三辆不同的汽车和一个行人绘制框。这对于实时应用至关重要,如自动驾驶,汽车需要确切知道障碍物在哪里以避免它们,或在零售业,摄像头跟踪货架上的产品以管理库存。
语义分割
语义分割将分析提升到像素级别。它将图像中的每个像素分类为类别,如道路、天空、树木或汽车。然而,它不区分同一类别的单个对象。如果图像中有三辆汽车,语义分割将把所有属于任何汽车的像素用相同的标签着色,实际上将它们视为一个大的汽车像素块。这对于区域的精确边界比单个对象更重要的任务非常有用,例如在医学成像中识别肿瘤区域,或在卫星图像中绘制森林或水体等土地利用。
实例分割
实例分割结合了目标检测和语义分割的优势。与语义分割一样,它对每个像素进行分类,但也区分同一类别的单个实例。如果有三辆汽车,它将它们标记为汽车1、汽车2和汽车3,为每个提供唯一的掩码。这是最精确的分析级别。它用于高级机器人技术,其中机器需要从一堆相似物品中拾取特定对象,或用于医学诊断,医生需要计数和测量单个细胞或病变,而不仅仅是识别组织的一般区域。
比较表
| 任务 | 输出 | 用例 |
|---|---|---|
| 图像分类 | 整个图像的单一标签 | 内容审核、图像分类 |
| 目标检测 | 带标签的边界框 | 自动驾驶、零售库存 |
| 语义分割 | 像素级类别标签 | 医学成像、卫星测绘 |
| 实例分割 | 每个实例的像素级掩码 | 机器人技术、医学诊断 |
结论
总之,任务的选择取决于所需的输出。当你只需要知道图像的一般内容时,使用图像分类。当你需要用边界框定位对象时,使用目标检测。当你需要理解整个场景中类别的形状和边界时,使用语义分割。当你需要识别、计数并精确勾勒图像中每个单独对象时,使用实例分割。
