1. 环境准备与数据标注:万事开头难,但也没那么难

很多朋友一听到“实例分割”就觉得头大,感觉比目标检测又复杂了一个维度。确实,它不仅要框出物体在哪里,还得精确地勾勒出物体的轮廓。但说实话,自从YOLOv8出来以后,这个门槛已经降低了很多。我刚开始接触的时候,也是从YOLOv5的检测任务转过来的,发现YOLOv8在分割任务上的封装做得真心不错,很多繁琐的步骤都给你简化了。所以,别怕,跟着我的步骤走,从零开始搞定一个你自己的分割模型,其实没那么遥不可及。

首先,咱们得把“厨房”收拾好,也就是搭建工作环境。我强烈建议你使用虚拟环境,这能避免各种包版本冲突的破事。用conda或者venv都行。打开你的终端,输入下面这行命令,把最新的ultralytics库装上。记住,一定要用-U参数,确保是最新版,因为官方更新挺频繁的,修复bug和增加新功能都靠它。

pip install -U ultralytics

装完别急着下一步,先验证一下。跑个简单的Python命令,看看能不能正确导入并打印出版本号。如果这一步没报错,显示出版本号(比如8.2.0),那恭喜你,环境基础就打好了。

python -c "from ultralytics import YOLO; print('YOLOv8版本:', YOLO.__version__)"

环境好了,接下来就是最核心、也最需要耐心的一步:准备你的数据。实例分割是“数据驱动”的典型,模型能学得多好,八成取决于你的数据质量。你需要准备的是图片和对应的标签文件。图片好说,用手机拍、网上找都行。关键是标签,它需要以多边形的形式精确标注出每个目标的轮廓。

这里我分享两个我常用的标注工具。如果你是新手,想快速上手,Labelme是个不错的选择。它界面直观,画多边形就像用Photoshop的套索工具一样,边点边连就行。标注完会生成一个.json文件。但YOLOv8训练需要的是特定格式的.txt文件,这时候就需要转换。幸运的是,ultralytics库自带了一个转换工具,你只需要运行下面几行代码,就能把Labelme的一堆json文件批量转换成YOLO格式。

from ultralytics.data.converter import convert_labelme2yolo
convert_labelme2yolo(labelme_json_dir="path/to/your/labelme_jsons", save_dir="path/to/save/labels")

如果你标注的数据量比较大,或者团队协作,那我更推荐CVAT这个在线工具。它功能更强大,支持视频标注自动插帧,对于分割任务尤其高效。CVAT可以直接导出YOLO格式的压缩包,解压后就是现成的.txt标签文件,连转换都省了,非常方便。

无论你用哪种工具,最终得到的每个标签.txt文件,内容格式都是固定的。我举个例子你就明白了。假设你有一张图,里面有一只猫和一只狗。那么对应的标签文件里,就会有这样两行:

0 0.12 0.15 0.23 0.18 0.25 0.30 0.18 0.35 0.10 0.32 0.08 0.20
1 0.45 0.50 0.55 0.52 0.58 0.60 0.48 0.65 0.42 0.62 0.40 0.55

第一行的0表示类别索引(对应“猫”),后面跟着的一长串数字,就是猫轮廓多边形上各个关键点的坐标。注意,这些坐标是归一化后的,即点的x、y坐标分别除以图片的宽度和高度,所以值都在0到1之间。第二行同理,1对应“狗”。一个多边形有多少个点,后面就跟多少对坐标。这就是YOLOv8实例分割能看懂的语言。

1.1 构建标准数据集目录

数据标注好了,文件可不能乱放。YOLOv8有一套约定俗成的目录结构,照着做能省去后面配置时无数的麻烦。我建议你按下面的树状结构来组织你的数据:

my_custom_dataset/
├── images/
│   ├── train/
│   │   ├── 001.jpg
│   │   └── 002.jpg
│   └── val/
│       ├── 003.jpg
│       └── 004.jpg
└── labels/
    ├── train/
    │   ├── 001.txt
    │   └── 002.txt
    └── val/
        ├── 003.txt
        └── 004.txt

简单来说,就是imageslabels两个主文件夹,下面各自再分train(训练集)和val(验证集)。验证集是用来在训练过程中评估模型泛化能力的,防止它只“死记硬背”训练数据。通常,你可以用80%的数据做训练,20%做验证。图片和标签的文件名要一一对应,比如001.jpg对应001.txt

这里有个我踩过的坑提醒你:图片的格式。虽然支持.jpg、.png等,但务必检查一下,别有些图片是.webp或者.bmp格式,YOLOv8可能读取出错。最好在标注前就用脚本统一转换成.jpg。另外,标签文件里多边形点的顺序,最好是顺时针或逆时针统一,虽然模型可能不敏感,但为了规范性,最好保持一致。

2. 模型训练:调参不是玄学,是有迹可循的“手感”

数据准备妥当,我们就可以开始“炼丹”了。训练模型就像厨师掌勺,火候(参数)不对,菜(模型)的味道就不行。YOLOv8提供了命令行和Python脚本两种方式,我两种都用过,各有优劣。

对于刚入门、想快速跑通流程的朋友,我强烈推荐先用命令行。一条命令,清晰明了,所有参数都摆在台面上。比如,你想用一个轻量级的模型在自定义数据上快速验证一下,可以这么写:

yolo segment train data=dataset.yaml model=yolov8n-seg.pt epochs=50 imgsz=640 batch=16 device=0

这条命令分解开来就是:用segment(分割)模式进行train(训练);数据配置来自dataset.yaml文件;使用yolov8n-seg.pt这个预训练模型(n代表nano,最小最快);训练50轮;输入图片缩放成640x640;每批处理16张图;使用第0号GPU。

但命令行方式在需要复杂控制或者集成到自动化流水线时就不太方便了。这时,Python脚本的优势就体现出来了。你可以灵活地设置回调、自定义日志、或者在训练前后插入自己的处理逻辑。下面是我常用的一个训练脚本框架,里面包含了一些我认为比较重要的参数设置:

from ultralytics import YOLO

model = YOLO('yolov8s-seg.pt')  # 我一般用s模型起步,平衡速度和精度

results = model.train(
    data='dataset.yaml',
    epochs=100,
    imgsz=640,
    batch=16,
    device='0',
    lr0=0.01,         # 初始学习率,数据量小可以调低到0.001
    lrf=0.01,         # 最终学习率系数,lr0 * lrf
    weight_decay=0.0005, # 权重衰减,防过拟合的利器
    warmup_epochs=3,  # 前3轮学习率预热,让模型“慢慢进入状态”
    box=7.5,          # 边界框损失权重
    cls=0.5,          # 分类损失权重
    dfl=1.5,          # 分布焦点损失权重(v8特色)
    pose=0.0,         # 姿态损失权重(分割任务为0)
    kobj=1.0,         # 目标关键点损失权重(分割任务为0)
    label_smoothing=0.0, # 标签平滑,小数据集可设为0.1
    nbs=64,           # 名义批量大小,用于梯度累积
    overlap_mask=True, # 掩码重叠处理,分割任务建议True
    mask_ratio=4,     # 掩码下采样比率
    dropout=0.0,      # Dropout率,防过拟合,通常0.0-0.5
    val=True,         # 训练中验证,必须开
    save=True,
    save_period=10,   # 每10轮保存一个检查点
    pretrained=True,  # 使用预训练权重,这是收敛快的秘诀
    optimizer='auto', # 优化器,auto通常是SGD
    seed=42,          # 随机种子,固定后结果可复现
    deterministic=True, # 确定性模式,保证可复现性
    single_cls=False, # 是否是单类别任务
    rect=False,       # 矩形训练,可加速但可能影响精度
    cos_lr=False,     # 余弦学习率衰减
    close_mosaic=10,  # 最后10轮关闭Mosaic增强
    resume=False,     # 是否从上次的检查点恢复训练
    amp=True,         # 自动混合精度训练,省显存提速
    fraction=1.0,     # 数据集使用比例,1.0即全部
    profile=False,    # 性能分析模式,平时关掉
    plots=True,       # 生成训练过程图表,非常重要!
)

跑起训练后,别干等着。打开runs/segment/train目录,你会看到实时生成的results.png。这张图是你的“炼丹炉监视器”,一定要会看。主要关注两条曲线:损失(loss)曲线平均精度(mAP)曲线

  • 损失曲线train/box_losstrain/cls_losstrain/dfl_loss是训练集上的损失,它们应该随着训练轮数稳步下降,然后逐渐趋于平缓。val/box_loss等是验证集上的损失,理想情况下也应该下降并趋于平稳。如果验证损失在中后期开始上升,而训练损失还在下降,那很可能就是过拟合了。
  • mAP曲线:这是衡量模型好坏的核心指标。metrics/mAP50(Segment)metrics/mAP50-95(Segment)是关键。mAP50只看IoU阈值为0.5时的精度,而mAP50-95是从0.5到0.95(步长0.05)多个IoU阈值下的平均值,更严格。我们主要追求mAP50-95这个值能稳定上升并收敛到一个较高的水平。

2.1 模型选择与参数调优实战经验

模型选哪个?这得看你的“家底”(硬件)和“追求”(精度)。我画个简单的表格给你参考:

模型规格参数量 (M)适用场景我的使用建议
yolov8n-seg~3.4移动端/嵌入式,显存极小(<2GB),追求极速原型验证,对精度要求不高的实时场景
yolov8s-seg~11.4入门级GPU(如GTX 1060/1660),平衡之选我最推荐新手起步用这个,速度精度都不错
yolov8m-seg~26.1主流GPU(如RTX 3060/3070),精度提升明显数据量较大(>3000张),对精度有要求
yolov8l-seg~44.5高性能GPU(如RTX 3080/4090)工业级应用,追求高精度
yolov8x-seg~69.1服务器级GPU(如A100/V100)科研或竞赛,冲击极限精度

参数调优方面,我分享几个立竿见影的技巧:

  1. 学习率(lr0):这是最重要的参数之一。如果你用的是预训练模型(pretrained=True),官方默认的0.01通常没问题。但如果你的数据集特别小(比如只有几百张),或者是从头开始训练(pretrained=False),建议把学习率调低一个数量级,设为0.001甚至0.0005,防止“步子太大扯着蛋”,导致训练发散。
  2. 数据增强:YOLOv8默认开启的数据增强已经很丰富了。对于分割任务,有两个增强特别有用:copy_pastemixupcopy_paste会随机复制一个目标粘贴到图片的其他位置,这能极大地增加小目标出现的概率,对于目标数量少的数据集效果拔群。mixup则是将两张图片线性混合,能增强模型的鲁棒性。但要注意,这些增强不宜开得太猛,尤其是数据集本身已经很大的时候,可能会引入噪声。我一般从copy_paste=0.1mixup=0.1开始尝试。
  3. 早停(patience):设置patience=50意味着如果验证集指标在50个epoch内没有提升,训练就会自动停止。这能有效防止过拟合和节省时间。你可以根据训练曲线来调整这个值,如果模型收敛很快,可以设小一点(如30);如果收敛慢,就设大一点。
  4. 图片尺寸(imgsz):更大的尺寸通常意味着更高的精度,但也会显著增加显存消耗和训练时间。640是一个很好的起点。如果你的目标物体非常小(比如遥感图像中的车辆),可以尝试增大到800甚至1024。反之,如果目标很大,或者显存紧张,降到512也行。记住:训练用的imgsz和后续推理、导出的imgsz最好保持一致。

3. 模型验证与性能分析:别被表面数字骗了

训练完成,生成了best.ptlast.pt,是不是就大功告成了?还早呢。验证这一步,是检验模型“真功夫”的关键,绝对不能敷衍。很多新手只看最终的mAP数字,这很容易被误导。一个在验证集上mAP很高的模型,可能在你的实际场景中一塌糊涂。

用Python脚本进行系统性的验证是最靠谱的。下面这个脚本不仅能计算指标,还能生成一系列可视化结果,帮你深入分析模型弱点。

from ultralytics import YOLO
import matplotlib.pyplot as plt

model = YOLO('runs/segment/train/weights/best.pt')

# 执行验证,并保存详细结果
metrics = model.val(
    data='dataset.yaml',
    imgsz=640,
    batch=16,
    device='0',
    conf=0.25,      # 置信度阈值,低于此值的目标被过滤
    iou=0.6,        # NMS的IoU阈值,用于合并重叠框
    save_json=True, # 保存为JSON格式,可用于COCO评估工具
    save_hybrid=True, # 保存混合标签,用于分析
    plots=True      # 生成混淆矩阵、F1曲线等高级图表
)

print("=== 关键指标 ===")
print(f"分割精度 mAP50: {metrics.box.map50:.4f}")
print(f"分割精度 mAP50-95: {metrics.seg.map:.4f}")
print(f"精确率 (Precision): {metrics.box.mp:.4f}")
print(f"召回率 (Recall): {metrics.box.mr:.4f}")

# 分析每个类别的表现
if metrics.box.ap_class_index is not None:
    print("\n=== 各类别详细AP ===")
    for i, class_index in enumerate(metrics.box.ap_class_index):
        class_name = model.names[class_index]
        ap50 = metrics.box.ap50[i]
        ap = metrics.box.ap[i]
        print(f"类别 '{class_name}': AP50 = {ap50:.4f}, AP50-95 = {ap:.4f}")

跑完这个脚本,你会在验证输出目录(通常是runs/segment/val)下看到很多新文件。其中,confusion_matrix.png(混淆矩阵)和F1_curve.png(F1置信度曲线)尤其重要。

  • 混淆矩阵:这张图告诉你模型最容易把哪两类物体搞混。比如,你的猫狗分割模型,如果矩阵中“猫”行“狗”列有个亮斑,说明有些猫被误认成了狗。这时候你就需要回去检查这两类物体的训练数据,是不是标注不够清晰,或者外观特征太相似,考虑增加更多有区分度的样本。
  • F1置信度曲线:F1分数是精确率和召回率的调和平均。这条曲线展示了在不同置信度阈值下,模型综合性能的变化。曲线顶点对应的置信度阈值,通常是最优的。你可以把这个最优阈值(比如0.4)记下来,在后续推理时使用,而不是死板地用默认的0.25。

注意:验证集的结果好,不代表万事大吉。一定要用从未参与训练和验证的图片,组成一个测试集,再跑一遍推理,看看实际效果。这是检验模型泛化能力的“试金石”。

3.1 结果可视化与错误排查

数字是冰冷的,图像才是直观的。YOLOv8在验证和推理时都可以保存带结果的可视化图片。但我更喜欢用脚本自己画,因为可以定制化地分析问题。

from ultralytics import YOLO
import cv2
import numpy as np

model = YOLO('runs/segment/train/weights/best.pt')
img_path = 'your_test_image.jpg'
results = model.predict(source=img_path, save=False, conf=0.25, iou=0.6)

# 获取第一个(也是唯一一个)结果
r = results[0]
orig_img = cv2.imread(img_path)
vis_img = orig_img.copy()

# 1. 绘制分割掩码(半透明覆盖)
if r.masks is not None:
    masks = r.masks.data.cpu().numpy()  # 形状: [N, H, W]
    for idx, mask in enumerate(masks):
        # 将掩码缩放到原图尺寸
        mask_resized = cv2.resize(mask, (orig_img.shape[1], orig_img.shape[0]))
        # 创建一个彩色掩码(这里按类别索引分配颜色)
        color_mask = np.zeros_like(vis_img)
        class_id = int(r.boxes.cls[idx])
        color = [(0, 255, 0), (255, 0, 0), (0, 0, 255)][class_id % 3]  # 示例颜色
        color_mask[:] = color
        # 将彩色掩码半透明地叠加到原图上
        vis_img = np.where(mask_resized[..., None] > 0.5, 
                          vis_img * 0.6 + color_mask * 0.4, 
                          vis_img).astype(np.uint8)

# 2. 绘制边界框和标签
if r.boxes is not None:
    boxes = r.boxes.xyxy.cpu().numpy()
    classes = r.boxes.cls.cpu().numpy()
    confs = r.boxes.conf.cpu().numpy()
    
    for box, cls, conf in zip(boxes, classes, confs):
        x1, y1, x2, y2 = map(int, box)
        label = f"{model.names[int(cls)]} {conf:.2f}"
        # 画框
        cv2.rectangle(vis_img, (x1, y1), (x2, y2), (0, 255, 255), 2)
        # 画标签背景
        (text_w, text_h), _ = cv2.getTextSize(label, cv2.FONT_HERSHEY_SIMPLEX, 0.6, 2)
        cv2.rectangle(vis_img, (x1, y1 - text_h - 5), (x1 + text_w, y1), (0, 255, 255), -1)
        # 写文字
        cv2.putText(vis_img, label, (x1, y1 - 5), cv2.FONT_HERSHEY_SIMPLEX, 0.6, (0, 0, 0), 2)

cv2.imwrite('detailed_analysis_result.jpg', vis_img)

通过这种自定义可视化,你可以清晰地看到:分割的边缘是否粗糙?小目标有没有漏检?两个挨得很近的物体,掩码有没有粘连?这些都是模型存在的问题。针对边缘粗糙,可以尝试在训练时使用更精细的标注,或者使用overlap_mask=True参数。针对小目标漏检,可以增加copy_paste增强的概率,或者在数据集中补充更多小目标样本。

4. 模型部署与落地:让模型真正“跑起来”

模型训练验证通过,精度也满意了,接下来就是把它用起来。YOLOv8提供了极其便捷的模型导出功能,可以轻松转换成各种部署框架需要的格式。最常用的就是ONNXTensorRT

ONNX是一种开放的模型交换格式,几乎被所有主流推理框架支持(如OpenVINO, ONNX Runtime, TensorRT等)。导出ONNX非常简单:

from ultralytics import YOLO

model = YOLO('runs/segment/train/weights/best.pt')
# 导出ONNX模型
success = model.export(format='onnx', imgsz=640, simplify=True, opset=12)

这里有几个参数需要注意:

  • imgsz:导出的模型会固定输入图片尺寸。务必和训练时一致,否则精度可能下降。
  • simplify=True:对计算图进行简化,可以优化一些结构,让模型更小、推理更快。建议开启。
  • opset=12:ONNX算子集版本。版本越高,支持的算子越多,但也要考虑部署环境的支持情况。12是一个比较通用稳定的版本。

导出的.onnx文件,你可以用Netron这个工具打开,可视化查看模型结构,确保导出正确。

如果你的部署环境是NVIDIA GPU,并且追求极致的推理速度,那么TensorRT是不二之选。TensorRT是NVIDIA推出的高性能深度学习推理SDK,能对模型进行层融合、精度校准等深度优化。YOLOv8也支持一键导出为TensorRT的.engine文件:

yolo export model=runs/segment/train/weights/best.pt format=engine imgsz=640

或者用Python脚本:

model.export(format='engine', imgsz=640)

这个过程可能会花点时间,因为TensorRT需要在你的特定GPU上进行优化编译。生成的.engine文件是硬件相关的,在A卡上编译的engine不能在N卡上用,甚至不同型号的N卡之间也可能不兼容。所以,最好在最终部署的机器上进行导出操作。

4.1 在Python中加载与推理导出的模型

模型导出后,我们就不再依赖庞大的ultralytics库了,可以用更轻量的运行时进行推理。这里以ONNX模型为例,展示如何使用onnxruntime进行推理:

import onnxruntime as ort
import cv2
import numpy as np

# 1. 加载ONNX模型和创建会话
onnx_model_path = 'path/to/best.onnx'
session = ort.InferenceSession(onnx_model_path, providers=['CUDAExecutionProvider', 'CPUExecutionProvider']) # 优先用GPU

# 2. 图像预处理(必须与训练时一致!)
def preprocess(image_path, input_size=640):
    img = cv2.imread(image_path)
    img_rgb = cv2.cvtColor(img, cv2.COLOR_BGR2RGB)
    # 保持长宽比缩放,并在边缘填充灰色
    h, w = img_rgb.shape[:2]
    scale = min(input_size / h, input_size / w)
    new_h, new_w = int(h * scale), int(w * scale)
    resized_img = cv2.resize(img_rgb, (new_w, new_h))
    # 创建画布并填充
    canvas = np.full((input_size, input_size, 3), 114, dtype=np.uint8)
    canvas[:new_h, :new_w, :] = resized_img
    # 归一化、转换通道顺序、增加批次维度
    blob = canvas.astype(np.float32) / 255.0
    blob = blob.transpose(2, 0, 1)  # HWC -> CHW
    blob = np.expand_dims(blob, axis=0)  # CHW -> NCHW
    return blob, img, (scale, new_w, new_h)

# 3. 执行推理
input_img, orig_img, (scale, new_w, new_h) = preprocess('test.jpg')
input_name = session.get_inputs()[0].name
outputs = session.run(None, {input_name: input_img})

# 4. 解析输出 (YOLOv8 ONNX输出格式:output0)
# outputs[0] 形状为 [1, 116, 8400],其中116=4(bbox)+80(cls)+32(mask)
prediction = outputs[0][0]  # [116, 8400]
# 这里需要实现后处理:非极大值抑制(NMS)和掩码上采样
# ... (后处理代码较长,涉及解码box、conf、mask coeff等,此处省略)

print("推理完成!")

对于TensorRT,可以使用pycudatensorrt的Python API来加载.engine文件并进行推理,流程类似,但能获得数倍的加速比。

最后,再提一个部署时的常见问题:动态尺寸输入。上面我们导出的模型固定了imgsz=640。如果你的应用需要处理不同尺寸的图片,可以在导出时指定动态尺寸,例如imgsz=[320, 640],但这会增加部署的复杂性,需要推理代码能处理动态形状。对于大多数生产环境,我建议还是将输入图片统一缩放到固定尺寸,这样最简单稳定。

从数据标注到模型部署,这一整套流程走下来,你会发现YOLOv8确实把实例分割的门槛拉低了很多。它把复杂的底层细节都封装好了,让我们能更专注于数据、业务逻辑和调优。我自己的经验是,第一个项目可能会磕磕绊绊,但成功跑通一次之后,后面再做类似的任务就会非常顺畅。关键是要动手去试,去踩坑,去看训练曲线,去分析bad case。模型训练本身有很多“黑盒”成分,但整个流程是清晰可控的。希望这份详细的解析,能帮你少走些弯路,更快地让YOLOv8实例分割模型在你的项目里跑起来。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐