MMPose 关键点标注实战:把 5000 张图的标注工期从三周压到一周
2026/9/20 2:52:57 网站建设 项目流程

MMPose 关键点标注实战:把 5000 张图的标注工期从三周压到一周

【免费下载链接】mmposeOpenMMLab Pose Estimation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmpose

手头一批 5000 张图、两个人、一周后要交付一个能直接训练的 MMPose 关键点标注数据集——这是很多一线工程组的真实处境。纯人工逐张点 17 个关节点根本来不及,机器全标又过不了质检。MMPose 关键点标注的半自动化思路,说白了就是"机器先铺底稿、人工再精修":让预训练模型把关键点先打一遍,人只改机器没把握的部分,效率通常能拉到 3~5 倍,同时把定位误差压到 3 像素以内。下面我们就按"一周、5000 张、2 人"这个硬约束,倒推每一步该怎么安排。

一周、5000 张、2 人:先把人力账算清

排期之前先算账,否则交付期就是拍脑袋。核心变量是"单人单日能修正多少张",这决定了整个盘子。

环节纯人工口径半自动口径
单人单日有效修正量约 80 张约 250 张
5000 张所需人天约 62 人天约 20 人天
2 人交付周期约 4 周1 周并留余量

结论:半自动之所以能把三周压进一周,靠的不是标得快,而是"机器打底后,人只在 30%~40% 的图上动手"。排期时把质检时间单列出来,别把它摊进标注工时里,否则最后一周一定会爆。

标注预标模型怎么选:RTMPose 与分辨率搭配

预标模型选错,后面全白干。选型标准只有一条:你的图里人是大是小、清不清。

档位适用场景单张典型耗时(GPU)
rtmpose-t图多、只要粗底稿约 0.1 s
rtmpose-m默认平衡档约 0.2 s
rtmpose-l / 384×288小人、密集、要精修约 0.5 s

避坑点:分辨率别低于 256×192,否则小目标的腕、踝会被糊掉,人工修正量反而上去。图里人普遍偏小就直接上 384×288 的 l 档,先少返工。

用 Pose2DInferencer 批量铺底稿

底稿由 mmpose/apis/inferencers/pose2d_inferencer.py 里的Pose2DInferencer负责,它内建检测器,能一次性输出关键点、置信度和可视化。关键参数是bbox_thr(检测框置信度阈值,建议 0.3~0.5)和pred_out_dir(结果落盘目录)。

from mmpose.apis import Pose2DInferencer inferencer = Pose2DInferencer( model='rtmpose-m', weights='rtmpose-m_simcc-coco.pth', det_model='rtmdet-m') result = inferencer('data/raw', bbox_thr=0.5, pred_out_dir='data/pre')

输入一个目录,输出带底稿的可视化图和预测结果,单张 1080p 图典型耗时在 0.2 s 上下。想先只铺检测框、再单独跑姿态,也可以换成 tools/misc/generate_bbox_file.py 先出候选框,方便和已有标注对拍。

Label Studio 的标注顺序与导出坑

底稿进 Label Studio 后,人工精修的规则必须提前定死,否则 tools/dataset_converters/labelstudio2coco.py 会把实例拼错。要点三条:

  1. 标注接口要同时含KeyPointLabelsPolygonLabelsRectangleLabels三类标签,分别对应 COCO 的 keypoints、segmentation、bbox。
  2. 同一实例的标注顺序必须是"先关键点、再多边形或框",且关键点个数、顺序要和 MMPose 配置里的dataset_info完全一致。
  3. 导出用 JSON,但长文件名会被截断——改走导出 COCO 的打包方式,图片文件夹随包一起拿,别手动拷散图。

密集场景里 ID 最容易串,多人交互的图建议在图名里带序号,肉眼对齐相邻帧,能省掉后面大量返工。

Label Studio 结果转 COCO 的转换命令

精修完导出 JSON,一条命令转成 COCO 格式,参数顺序是"接口 XML、输入 JSON、输出路径":

python tools/dataset_converters/labelstudio2coco.py \ label_interface.xml annotations.json out/coco.json

转换完把图片文件夹放进out/下,配好ann_filedata_prefix就能直接进训练配置。格式对不对,用 tools/misc/browse_dataset.py 抽几十张可视化一眼看穿,比跑训练早发现问题。

验收标准怎么定:抽检、Kappa 与误差口径

交付不能靠"看起来没问题"。这里给一套可落地的验收口径:

  • 抽检比例:每批抽 10%,两人各标一遍交叉比对。
  • Kappa 系数(衡量两名标注员打样一致性的指标):低于 0.7 就回炉重训标注规范,别硬交。
  • 定位误差:抽检样本上关键点到真值的偏差控制在 3 像素以内,遮挡关节按"可见才标"统一口径。
  • 底稿采纳率:机器底稿被人工原样保留的比例约 60%~70% 属正常,过低说明预标模型没选对档位。

这套标准既是验收线,也是下一批预标模型的调参依据——采纳率持续走低,就该换更高档位的预标模型。

按数据规模选策略:三档建议

最后按图量给分档建议,别一套流程用到底:

  • 小于 1k 张:适合全人工 + 机器可视化自查,规则简单、返工可控,别为省时间引入半自动反而拖慢。
  • 1k~10k 张:建议本文的"RTMPose 铺底稿 + Label Studio 精修 + COCO 转换"基础半自动流程,就是上面的主线。
  • 大于 10k 张:建议在基础流程上加"按场景拆分任务 + 底稿采纳率驱动换档",用 tools/analysis_tools/analyze_logs.py 盯完成率和质量曲线,人力按场景分池。

选型的本质是"返工成本 vs 预标精度"的取舍:图越杂、人越小,越值得在预标档位上多花钱。

【免费下载链接】mmposeOpenMMLab Pose Estimation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmpose

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询