CVAT 实测:跑通 5 类标注场景后,这份图像视频标注工具选型指南帮你省 3 天
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
一段 3 分钟的视频,手工给 200 个行人拉框,画完你可能想砸鼠标——而训练数据就卡在等你。这篇文章带你过一遍 CVAT 这个开源图像/视频标注工具:它怎么把"逐框硬画"变成"模型先画、你来改",以及自托管、云端、企业版该选哪个。
它到底帮你解决什么问题
一句话说清定位:让团队在浏览器里把原始图片、视频、点云变成能直接喂模型的训练集。核心是三件事——10 种以上标注对象(矩形、多边形、mask、骨架、3D 立方体、标签等)、可接入模型的自动标注、以及 20+ 种业界格式的导入导出(COCO、YOLO、Pascal VOC、KITTI 等),标注完不用再做格式转换的胶水工作。
从下载到出结果的 3 分钟路径 🐳
最快的路是浏览器:官网有免费计划,注册就能标,适合先感受再决定要不要自托管。想数据留在自己机器上,按这条线走:
- 克隆仓库并启动服务(需要 Docker):
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat && docker compose up -d- 创建管理员账号:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'- 打开 http://localhost:8080 → 登录 → New task → 添加一个 label → 上传几张图或一段视频 → 在画布上点选 Rectangle 画第一个框 → 保存后 Export dataset,选 YOLO 格式下载。
从docker compose up -d到导出第一个标注文件,顺利的话 10 分钟内能走完。注意它主要适配 Chromium 系浏览器,Safari 不支持。
按你要做的事拆功能 ⚡
不按模块讲,按任务拆。下表覆盖最常见的 5 类:
| 你要做的事 | 用什么 | 实际体验 | 适合的数据 |
|---|---|---|---|
| 2D 目标检测 | 矩形 + Track 自动补帧 | 首帧画框,沿视频自动延伸;可用 YOLOv7、Faster RCNN 预标 | 图片集、监控视频 |
| 精细分割 | 多边形 / Mask / 画笔 | 配 SAM、IOG 等交互模型,点两下出 mask | 医学影像、遥感图 |
| 视频目标跟踪 | Track + 插值 | 画首尾关键帧,中间帧自动插;TransT 可做跟踪 | 动作视频、轨迹数据 |
| 骨架姿态 | Skeleton shape | 逐关键点标注,HRNet32 可自动出姿态 | 体育、人体动作 |
| 3D 点云标注 | 立方体 + 三视图同步 | Top/Side/Front 联动,KITTI 格式直出 | 激光雷达 PCD/BIN |
自动标注的入口在创建任务时选模型即可,内置 9 个预置 serverless 模型,覆盖检测(YOLOv7、RetinaNet、Mask RCNN、人脸检测)、分割交互(SAM、IOG)、姿态(HRNet32)和跟踪(TransT)。模型清单见 serverless 模型目录,格式实现可查 formats 源码。
版本与方案选型对照(怎么选)
| 方案 | 功能范围 | 成本 | 适合谁 |
|---|---|---|---|
| 云端免费计划 | 完整标注功能,SSO、内置 SAM 2/3 等高级功能需付费 | 免费,有计划用量限制 | 个人试用、快速验证想法 |
| 社区自托管(本仓库) | 开源全功能,MIT 协议,可二次开发 | 免费,自备服务器 | 数据不能出内网的小团队 |
| 企业版 | SSO、SLA、技术支持、高级功能 | 付费 | 有安全合规要求的企业 |
| 外包标注服务 | 不自己干活,由对方团队标注 | 付费 | 没有自有标注团队 |
选择建议:先试用就点云端免费版;一旦"数据必须留在自己机房"成立,直接上社区版自托管;需要 SSO 和 SLA 再谈企业版。
谁已经在用:场景速览
- 自动驾驶团队:相机视频拉 2D 框、激光雷达点云标立方体,KITTI 格式直出——解决 2D/3D 两套标注工具来回搬数据的问题。
- 姿态估计组:先人工标 100 帧做种子,用 HRNet32 把其余帧自动标出来,人只做修正,标注周期从按周算变按天算。
- 数据管线工程师:用 Python SDK 建任务、标完导出 COCO,直接接进训练流水线;分析面板还能看到每个任务的工作时长和标注速度,方便核算人力。
- 多人协作项目:consensus 机制让多人对同一段视频各标一份,交叉比对找分歧,Issue 标记返工点,减少"标完才发现问题"的返工成本。
坦诚说:优点和已知局限
优点:一是数据主权+MIT 协议,整套跑在内网,数据不离开你的环境;二是格式生态最全,20+ 种进出格式、2D/3D/音频标注在同一套系统里;三是自动化面完整,REST API、Python SDK、CLI 三件套都有,SDK 示例可以直接抄。
局限:自动标注不是开箱即用的——serverless 组件(Nuclio + nuctl)要单独部署,有一定运维门槛,预置模型也只有 9 个;浏览器支持保守,Safari 直接不支持;SSO、内置 SAM 2/3 自动标注、AI agents 属于付费计划,社区版里看不到。
同类项目横评
- Label Studio:模板自定义更灵活,结构化数据(OCR、表单类)很顺手;但视频插值和 3D 点云的深度不如 CVAT——视频/3D 为主选 CVAT,混合数据类型多再评估 Label Studio。
- VIA(VGG Image Annotator):单页极轻量,打开就画,适合个人快速标几十张图;但没有协作、没有 Track、没有 3D——轻量个人场景选它,团队场景选 CVAT。
下一步:按你的情况走
- 个人玩家:注册云端免费版,导一个 50 张的测试集,先标 10 张导出 YOLO 格式,把"上传→标注→导出"全流程跑通一遍,再决定要不要深用。
- 小团队:找台 16GB 内存的机器
docker compose up -d,第一个任务就用视频跟踪练手——100 帧的片段标 2 帧,看插值效果,这是 CVAT 最直观的体验点。 - 企业:先部署社区版验证数据流(含 S3/Azure 云存储对接),同时把 SSO 和 SLA 需求列给厂商,评估企业版报价,别一开始就买。
现在就可以动手:打开终端把仓库拉下来,跑docker compose up -d,等几分钟 localhost:8080 就能打开,你的第一个矩形框离得很近。更多细节可看 cvat-core 标注对象源码。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考