☰
实时视频问诊AI的工程实践:从系统架构到落地闭环
2026/9/25 4:05:54 网站建设 项目流程

最近在一次远程会诊尝试中,一个场景让我印象很深。患者拿着手机让医生看手臂上的皮疹,镜头一直在晃动,光线忽明忽暗,医生一边问“什么时候开始的”“痒不痒”,一边想让AI助手帮忙把这段视频里的症状变化记录下来。结果AI只给出了一段转写文字,既没有指出皮疹的形态变化,也没能把患者的口述和影像放到同一个时间轴里。这个画面,恰好解释了“Towards Expert-level Medical AI for Real-time Video Consultations”这个标题里最容易被误读的部分:专家级,并不意味着AI要顶替医生,而是要让实时视频问诊这个信息链路,第一次被系统性地理解、组织和增强。

如果只把它当成一个“更聪明的识别模型”,方向就偏了。医疗AI在实时视频场景下真正困难的地方,在系统级:如何把实时视频、语音、医学知识、多轮对话、风险控制和医生的最终决策,编织成一条低延迟、可审核、可回滚的工作流。这篇博客想从工程视角拆解三件事:实时视频问诊的AI到底要做什么,一个最小可落地的实验闭环怎么搭,以及落地过程中最常见的四个问题和排查思路。

1. 先搞清楚实时视频问诊里的AI,究竟要承担哪些角色

1.1 诊断不是单张照片识别,而是“观察—追问—验证”的循环

传统医疗影像AI处理的是静态图,输入一张片子,输出一个分类或分割结果。但实时视频问诊完全不是这个范式。患者对着镜头说话,可能要展示动作、翻转患处,医生在另一端不断追问,患者也会临时补充信息。这里面的信息是动态的、多模态的、跨时间的。

一个医生在视频问诊时实际在做的事,可以拆成四步:先观察患者状态和病灶表现,再根据观察结果追问关键信息,然后结合患者口述和病史形成初步判断,最后通过追问或复查验证判断。AI如果想接近“专家级”,就必须参与这个循环,而不只是对某一帧图像给结论。

这意味着,系统不能只做“视频理解”,还要做“对话管理”。它需要知道当前这句话是在回答哪个问题,当前画面里手的动作是在展示疼痛范围,还是在翻阅病历。更麻烦的是,这些信息都有时间戳,AI必须在时间轴上把它们对齐,才能理解“患者说昨晚开始痒,视频里皮肤发红区域从手肘蔓延到前臂”这个描述到底意味着什么。

所以,实时视频问诊医疗AI的第一个认知转变是:它不是单一视觉模型,也不是单一对话模型,而是一个多模态时序理解系统。

1.2 四个必要角色:感知器、推进器、记录器、守门员

我习惯把一个完整的实时视频问诊AI拆成四个角色,便于团队讨论边界。

第一个是感知器。它从视频流和音频流中提取信息,例如识别面部表情、动作、病灶区域、语音转写、语调变化。它不负责判断病情,只负责把“看到了什么”“听到了什么”变成结构化描述。

第二个是推进器。它基于当前对话上下文,决定下一步该问什么。比如患者描述“头晕”,但没有说持续时间,AI可以生成一个追问:“这种情况是第一次出现,还是反复发作?”它不是独立问诊,而是建议医生或者直接面向患者提问,但最终由医生确认。

第三个是记录器。它把整个视频问诊过程转成结构化病历草稿,包括主诉、现病史、观察发现、检查建议、初步印象。这个角色最容易给医生创造价值,因为医生最烦的就是边问诊边打字记录。

第四个是守门员。它负责识别危险信号,例如胸痛伴随出汗、呼吸困难、意识模糊,或者患者提到自杀倾向。这类情况需要停止常规流程,建议立即转急诊或拨打急救电话。守门员不能接在医生后面,而应该和整个流程并行,实时监测。

这四个角色不是四个独立的模型,大概率是一套模型加规则引擎加知识库的组合。但在产品设计上,它们必须被当作独立模块,因为它们的输入输出、延迟要求、失败处理方式都不一样。

1.3 为什么“专家级”是一个过程,不是一锤子

标题里最关键的一个词是“Towards”,也就是“迈向”。这个词说明,专家级医疗AI不是已经完成的状态,而是持续逼近的方向。这也提醒我们,不要用“准不准”作为唯一衡量标准。

真正的专家级,在临床语境里不只是“知道答案”,更是“知道边界”。一位有经验的医生面对不典型症状时,会说“目前证据不足,需要进一步检查”,而不是强行给一个猜测。AI也一样。当它遇到模糊图像、不完整病史、矛盾描述时,最好的输出不是硬给诊断,而是明确表达不确定性,并建议补充哪些信息。

所以,评估一个视频问诊AI是否“专家级”,必须看一个指标:它是否知道什么时候该停下来、什么时候该把问题交给人类医生。这个能力,比某一个病种的准确率更稀缺,也更难做。

2. 拆开看实时链路:从摄像头到诊断建议,中间发生了什么

2.1 不是“视频进、诊断出”,而是多个子任务的时序编排

很多人第一次做视频问诊AI时,会想当然地认为:把视频流送给一个多模态大模型,就能输出诊断建议。这在演示环境里似乎可行,但一旦进入真实问诊,问题就出现了:视频是持续的,患者不会刻意配合;音频可能有背景噪音;诊断需要结合历史对话;生成建议必须够快;结果要能被医生审核和修改。

更合理的架构不是一个大模型包办,而是一条编排链路。常见的基础流程是这样的:

video_stream + audio_stream | v [视频抽帧] [流式ASR] | | v v [视觉描述模型] [转写文本] | | +-----> 时间点对齐 <-----+ | v [多轮对话上下文 + 知识库检索] | v [生成结构化记录/建议草稿] | v [医生审核/修改/确认]

这段流程里,视觉描述模型不直接下诊断,只负责描述“看到什么”;ASR只负责把语音变成文字;知识库检索则从医学资料中找相关的鉴别诊断和注意事项。最后一步才是生成草稿,而且生成之后必须经过医生审核。

这个架构最大的优势是:每个环节都可以单独替换、单独测试。如果识别不准,可以诊断是抽帧太稀疏,还是视觉模型不合适,而不是整个系统黑盒。

2.2 关键矛盾:实时性和准确性之间的取舍

视频问诊里最头疼的问题,不是某一个模型能力不够,而是“实时”两个字。医生问完问题,AI不能等10秒才回应,那样对话节奏就断了。从产品体感来说,AI辅助信息的延迟最好控制在2到3秒以内,关键提示甚至要更低。

实时性倒逼架构做取舍。比如,视觉信息不能等整段视频结束再抽帧,通常要边采边抽,按照固定间隔或运动检测(画面变化大时多抽帧)来截取关键帧。语音转写也不能等整句话结束再识别,需要流式ASR,边说话边出词,方便后续模块提前准备。

同样,常规的“截取视频片段再丢给大模型”的做法,在实时场景里经常要改成双通道:一个高帧率通道做轻量级视觉事件检测,比如“手抬起”“面部有痛苦表情”;另一个低帧率通道做精细病灶分析。轻量通道负责及时性,精细通道负责准确性,最后再做融合。

这里有一个常见的工程误区:为了追求准确,把所有视频帧都送进一个大模型,结果延迟爆炸。实际上,在医疗问诊里,许多关键信息是稀疏的,一个10分钟的视频,真正有诊断价值的画面可能只有几秒。用运动检测、人脸检测、语音关键词触发等手段,先把这些关键时刻找出来,再去跑重模型,会务实很多。

2.3 数据、标注、隐私:真实的视频问诊数据比模型更稀缺

比模型选型更棘手的,是数据。实时视频问诊数据的获取难度,比静态医学影像高一个量级。

静态影像有公开数据集,但“医生和患者对话的视频”几乎没有公开的大规模标准数据集。原因很简单:这类视频包含大量个人健康信息,涉及隐私合规,采集需要患者授权,标注需要医生参与,而且标注的维度很复杂。不只是标出病灶区域,还要标出时间点、对话轮次、症状语义、医生提问意图、患者回答质量。

还有一个容易被忽视的问题:视频数据的时间轴标注。一段视频里,患者可能在第2分钟说“这里疼”,在第5分钟才把疼痛区域展示给镜头。如果标注系统只记录文本和图像标签,不记录时间戳,模型就无法学会“图像内容 + 口语描述”的对应关系。这个时间轴的对齐能力,是实时视频问诊AI和普通视觉AI最大的差别之一。

因此,如果要做这个方向,要有心理准备:模型往往不是瓶颈,标注规范和数据采集协议才是。建议先和医院或专科门诊合作,从授权的、小规模的会诊录像做起,建立一套去标识化处理和时间轴标注流程,而不是先去找现成数据集。

3. 可落地的实验方案:把“专家级”放一边,先跑通辅助闭环

3.1 收窄范围:选择单一专科和单一任务开始

很多团队一上来就想做一个通用医疗AI,能看任何病,还能实时问诊。这个范围太宽,几乎必败。更稳妥的做法是选一个专科和一类任务先做闭环。

我比较推荐三个方向:

  • 皮肤科视觉描述:患者拍摄皮疹、痘痘、指甲等问题区域,AI负责描述皮疹形态、颜色、边界、分布范围,并给出鉴别问题清单。
  • 慢病随访:例如高血压、糖尿病患者的居家视频随访,AI根据患者回答和视频画面记录用药、饮食、运动情况,并提醒异常指标。
  • 康复动作评估:患者对着屏幕做康复动作,AI从视频中识别动作角度、对称性、完成度,辅助康复师评估恢复进展。

这些方向有一个共同特点:问题边界相对清楚,视觉信息可观察,风险相对可控。选好方向后,任务也可以再窄一点,例如“只做结构化记录”,不要一开始就要求AI给出诊断。

3.2 最小系统组件和输入输出

一个最小实验系统不需要太复杂,下面这些组件缺一不可:

组件输入输出说明
视频采集端摄像头 / 录屏视频流可以是WebRTC,也可以先录制文件
音频转写模块音频流带时间戳的文本用流式ASR,记录每句话的开始结束时间
关键帧抽取视频流图片集合固定间隔 + 运动检测结合
视觉描述模型关键帧图像描述不判断疾病,只描述所见
知识库检索文本描述 + 对话历史相关医学知识片段使用RAG方式,限定检索范围
对话管理模块转写文本、视觉描述、检索结果追问建议 / 风险提示输出给医生或患者
医生审核面板AI草稿医生修改后的记录必须支持一键提交和修改留痕
日志与回放全流程数据可审计日志记录每一步模型的输入输出供回看

组件不必一开始就完全工程化。可以先用本地脚本把录制视频跑通,再逐步换成实时链路。

3.3 四步走:从转写到草稿,再到医生确认

我建议按四个阶段逐步增强,每一步都有明确验收标准,而不是一次性搭建完整系统。

第一步,先做“视频转写 + 基础结构化”。把一段10分钟的问诊视频录下来,转成文本,再让文本模型把内容整理成“主诉、现病史、用药情况、医生初步建议”的粗结构。验收标准很简单:医生能看懂整理后的内容,并且觉得比原始逐字稿省时间。

第二步,接入关键帧视觉描述。在转写的同时,每隔一定时间抽取画面,把视觉描述和转写文本按时间戳对齐,生成图文混排的记录草稿。验收标准是:医生能从草稿里回看患者展示的关键部位,而不用重新拖视频。

第三步,加入知识库和追问建议。引入一个垂直医学知识库,根据当前对话和视觉描述检索相关内容,生成“可能需要追问的问题”或“需要重点观察的风险项”。验收标准是:建议里至少有一半的问题医生觉得有价值,不能有方向性错误。

第四步,接入医生审核闭环。把AI生成的结构化记录和风险提示送到医生面板,医生可以修改、删除、签字确认。只有医生确认后的内容,才写入最终病历。验收标准是:医生愿意在真实二次问诊中使用,且修改率低于可接受阈值。

这四步里,最核心的逻辑是:每一步都不追求“AI替医生做决定”,而是让AI先把信息和草稿准备到足够好,再由医生做最终判断。这就是最小闭环和真实可用之间的唯一桥梁。

3.4 评估维度:不要只盯准确率

视频问诊AI的评估,远不止“分类准确率”或者“回答正确率”。如果只盯准确率,很可能会忽略实际使用中的系统问题。

我建议至少用五个维度做评估:

  • 延迟:从患者说话或展示画面到AI生成辅助信息的时间。记录P50和P95延迟,P95比平均值更重要。
  • 医生介入率:AI直接生成并最终被医生原样采纳的比例。采纳率过高不一定好,过低则说明帮助有限。
  • 记录效率:记录一份病历草稿需要多长时间,医生修改需要多久。这是ROI的直接体现。
  • 风险召回率:模拟几个需要转诊或紧急处理的场景,看系统是否都能及时触发风险提示。宁可误报,不能漏报。
  • 可追溯性:每个AI结论能不能回溯到原始视频、语音和知识库来源。没有来源的结论,在医疗场景里等于不存在。

这五个维度,比单个模型指标更能反映系统是否“可用”。

注意:医疗AI的评估必须包含医生参与。不要让技术团队单方面定义“正确”,因为医学问题里,很多答案没有唯一标准。

4. 落地中的四个高频问题和排查路径

4.1 为什么AI回复很慢?先分段计时,再决定砍哪里

实时视频问诊最常遇到的反馈就是“太慢了”。一慢,医生和患者的对话节奏就会被打断。排查慢的问题时,不要先怀疑模型本身,而是要从数据流上分段排查。

排查顺序是:先看视频采集端编码是否正常,再看网络传输是否有瓶颈,然后看ASR是否在等待整句结束才输出,接着看视觉模型排队是否严重,最后看生成建议时是否多次调用模型、是否能并行。

一个常见坑是:把ASR、视觉描述、知识检索、LLM生成串行执行。实际上,视觉描述和ASR在时间上可以并行;知识检索也可以在文本积累到一定程度后就提前开始。把串行改成并行,延迟往往能缩短一半以上。

另一个常见坑是:在一段视频里把所有关键帧一次性塞进视觉模型,导致推理队列繁忙。更优做法是只选取变化最大的几帧,或者做异步队列处理,不阻塞主对话流程。

4.2 为什么回答“看上去很专业,但细节飘”?多半是检索和上下文管理出了问题

一个很典型的体验是:AI说的话一套一套,但仔细看,它并没有真正回应患者当前的问题。这可能不是生成能力弱,而是上下文没有组织好。

排查时按这个顺序看:

  1. 检查输入给模型的文本,是否丢失了最近的对话轮次。很多系统为了控制token,把早期对话截断了,结果模型看不到关键信息。
  2. 检查视觉描述和转写是否对齐。如果时间轴偏移,模型可能把“患者说左侧疼”描述成“右侧疼”。
  3. 检查知识库检索结果。如果检索到的内容很泛,比如都是教科书定义,模型就容易生成“正确的废话”。需要改成检索与当前问题匹配的鉴别诊断和注意事项。
  4. 检查prompt里的任务约束。是否让模型区分“观察事实”和“推测判断”,是否要求它在信息不足时明确说不知道。

细节飘的实际原因,通常是某个中间结果不可靠,但生成模型把不可靠的输入当成了事实。所以在工程上,要尽可能让每个中间步骤输出结构化、带置信度的信息,而不要直接丢给LLM一段杂乱的原始文本。

4.3 为什么模型会给出越界建议?因为只限制了生成,没有限制输入和出口

医疗AI最敏感的问题就是越界,比如AI直接给处方、建议用某种药物,或者过度自信地排除肿瘤可能。这是绝对不能接受的。

越界问题不能只靠“prompt里写清楚不要提供治疗建议”来解决。更稳妥的做法是三层控制:

  • 输入侧:限定系统的输入范围,不要把所有医学知识都交给模型,只检索与当前病种相关的、经过审核的知识片段。
  • 生成侧:在prompt中明确角色边界,要求只描述观察、整理信息、提出鉴别问题,不写具体药物剂量和治疗方案。
  • 出口侧:设置规则引擎或后置校验,对包含“建议用药”“停止服药”等敏感关键词,或涉及危重症状描述的输出,强制拦截并转入人工审核。

这层控制应该作为系统底线,独立于模型判断。技术团队宁可多拦,也不能漏放。任何时候,AI的输出都只能是“草案”,而不是“医嘱”。

4.4 为什么医生不愿意用?缺的不是准确率,而是信任控制和证据回放

很多团队发现,AI准确率已经挺高了,但医生就是不愿意用。问题往往不在技术,而在信任。医生是不敢对着一团黑盒AI的输出签字的。

要解决这个问题,系统必须给医生足够的控制权和证据。我的具体建议是:

  • AI生成的每一句话,都要能回溯到原始视频片段、转写文本或知识库来源。医生能点击查看“这句话是怎么来的”。
  • AI结论要显示置信度或信息完整度。比如“观察到皮疹边界清晰,但患者未提供疼痛程度”,让医生明白AI是不是在信息不足下硬猜。
  • 必须支持一键转人工。医生可以随时停掉AI介入,完全自己主导问诊。
  • 所有AI输出和医生修改都应该留痕。这既是为了安全合规,也是为了让医生逐步发现AI真正可靠的部分。

当医生发现,AI可以把重复的信息采集和记录工作接过去,同时在不确定时主动闭嘴、让出控制权,他们自然愿意用。

回到一个更朴素的判断上

医疗AI的“专家级”,不在某个大模型的参数里,而在系统边界里。一个实时视频问诊系统能不能用,不在于它能不能“读片出结论”,而在于它能不能在恰当的时候提供恰当的信息,并让医生拥有最终否决权。

所以,以后再看到“专家级医疗AI”这个概念,我的建议是不要先问准确率,而是先问三个问题:

当它不确定时会发生什么?当它错了会怎样?医生在流程里的控制权在哪里?

这三个问题想清楚了,离真正的可用系统就不远了。剩下的只是工程。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询