从3条命令到可训练数据集:CVAT 数据标注实战
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
手里有几百张图要标,后天就要喂给训练脚本。你一个人画框太慢,换格式又怕对不上框架要求。CVAT(Computer Vision Annotation Tool)是开源的图像、视频和 3D 数据标注平台,能帮你把原始图片变成 YOLO、COCO 这类现成格式的数据集。这篇文章按一个真实小项目的推进顺序写,适合第一次跑项目的你。
3条命令跑起本地CVAT环境
想先摸一遍界面,直接用官方在线版,浏览器打开就能试,不用装任何东西。真要跑项目,还是本地部署稳。装好 Docker 和 Docker Compose 后执行:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d再建一个管理员账号:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'浏览器打开http://localhost:8080,登录就能用。如果是团队规模部署,仓库里带了 helm-chart/,Kubernetes 集群方案基本一句话说完。
第一张标注:画框、加属性、熟悉界面
登录后创建一个 Project,在 Project 下建 Task,上传图片,定义好标签(类别名加颜色)。打开标注页后:
- 左侧工具栏选 Rectangle,在画布上拖出框;
- 右侧给这个框选标签,标签带属性的话在这里填;
- 画歪了按 Z 撤销,按 X 重做,拖动顶点微调框的位置。

除矩形外还有多边形、画笔、mask、关键点等工具。第一个项目建议只挑一两种练熟,不必把工具栏翻遍。用画笔标的时候,可以调笔的粗细和透明度刷出目标,再让工具把区域闭合起来。
让AI先画,你只做修正
几百张全手画还是慢。CVAT 的思路是把模型部署成函数,标注页面直接调用。仓库的 serverless/ 目录自带一批可部署的检测、分割和姿态模型,比如 YOLOv7、Mask R-CNN、SAM、TranST。以 SAM 为例:
./serverless/deploy_gpu.sh这条命令把函数拉起来。之后在标注页点 Auto Annotation,选中模型,给个置信度阈值,让它先出一版底稿。
自动标注的定位是打底,不是交稿。人主要修三处:低置信度的框、漏检的目标、类别搞混的对象。AI 负责从 0 到七成,你负责从七成到可交付。视频任务还能圈 ROI 限定范围,省算力也省时间。
导出格式怎么选,怎么接训练脚本
标完之后在 Task 页选格式导出。CVAT 支持 20 多种导出格式,常用的就这几个:YOLO 是行式 txt,YOLO 系训练脚本直接吃;COCO 是 JSON,检测和实例分割常用;Pascal VOC 是 XML,老项目里还在用。拿不准时想一步:你的训练脚本读什么,就选什么。
点导出之前,顺手看一眼内置分析页。谁标了多少、进度卡在哪都摊在页面上,有缺口当场补。导出会得到一个 zip,里面是图片、标签文件和说明,把训练脚本的数据目录指过去就能开跑。
交付前再查一遍
多人协作时,让同事互相 review 对方的 job,角色和审核流在 CVAT 里都是现成的;质量校验还能把标注员之间的分歧挑出来。接下来你可以做两件具体的事:把同一个任务分别导出 YOLO 和 COCO,对比两种文件结构长什么样;再往 serverless 里挂一个别的检测模型,和第一个比谁的漏检少。做完这两步,上一个大项目就有底了。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考