从3条命令到可训练数据集:CVAT 数据标注实战
2026/9/10 9:58:19 网站建设 项目流程

从3条命令到可训练数据集:CVAT 数据标注实战

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

手里有几百张图要标,后天就要喂给训练脚本。你一个人画框太慢,换格式又怕对不上框架要求。CVAT(Computer Vision Annotation Tool)是开源的图像、视频和 3D 数据标注平台,能帮你把原始图片变成 YOLO、COCO 这类现成格式的数据集。这篇文章按一个真实小项目的推进顺序写,适合第一次跑项目的你。

3条命令跑起本地CVAT环境

想先摸一遍界面,直接用官方在线版,浏览器打开就能试,不用装任何东西。真要跑项目,还是本地部署稳。装好 Docker 和 Docker Compose 后执行:

git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d

再建一个管理员账号:

docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'

浏览器打开http://localhost:8080,登录就能用。如果是团队规模部署,仓库里带了 helm-chart/,Kubernetes 集群方案基本一句话说完。

第一张标注:画框、加属性、熟悉界面

登录后创建一个 Project,在 Project 下建 Task,上传图片,定义好标签(类别名加颜色)。打开标注页后:

  1. 左侧工具栏选 Rectangle,在画布上拖出框;
  2. 右侧给这个框选标签,标签带属性的话在这里填;
  3. 画歪了按 Z 撤销,按 X 重做,拖动顶点微调框的位置。

![CVAT标注界面:矩形框与属性标注面板](https://raw.gitcode.com/GitHub_Trending/cvat/cvat/raw/2b75e8fdc0a4242b93deea076c1bbad7c8e67c85/site/content/en/images/Attribute annotation mode_01.png?utm_source=gitcode_repo_files)

除矩形外还有多边形、画笔、mask、关键点等工具。第一个项目建议只挑一两种练熟,不必把工具栏翻遍。用画笔标的时候,可以调笔的粗细和透明度刷出目标,再让工具把区域闭合起来。

让AI先画,你只做修正

几百张全手画还是慢。CVAT 的思路是把模型部署成函数,标注页面直接调用。仓库的 serverless/ 目录自带一批可部署的检测、分割和姿态模型,比如 YOLOv7、Mask R-CNN、SAM、TranST。以 SAM 为例:

./serverless/deploy_gpu.sh

这条命令把函数拉起来。之后在标注页点 Auto Annotation,选中模型,给个置信度阈值,让它先出一版底稿。

自动标注的定位是打底,不是交稿。人主要修三处:低置信度的框、漏检的目标、类别搞混的对象。AI 负责从 0 到七成,你负责从七成到可交付。视频任务还能圈 ROI 限定范围,省算力也省时间。

导出格式怎么选,怎么接训练脚本

标完之后在 Task 页选格式导出。CVAT 支持 20 多种导出格式,常用的就这几个:YOLO 是行式 txt,YOLO 系训练脚本直接吃;COCO 是 JSON,检测和实例分割常用;Pascal VOC 是 XML,老项目里还在用。拿不准时想一步:你的训练脚本读什么,就选什么。

点导出之前,顺手看一眼内置分析页。谁标了多少、进度卡在哪都摊在页面上,有缺口当场补。导出会得到一个 zip,里面是图片、标签文件和说明,把训练脚本的数据目录指过去就能开跑。

交付前再查一遍

多人协作时,让同事互相 review 对方的 job,角色和审核流在 CVAT 里都是现成的;质量校验还能把标注员之间的分歧挑出来。接下来你可以做两件具体的事:把同一个任务分别导出 YOLO 和 COCO,对比两种文件结构长什么样;再往 serverless 里挂一个别的检测模型,和第一个比谁的漏检少。做完这两步,上一个大项目就有底了。

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询