边缘AI这几年是真的热,但热词背后到底在做什么,很多人其实没太搞清楚。我自己从2018年开始接触端侧智能,先做的是给摄像头加人脸识别,后来慢慢做到家庭场景里的小型智能体,算是看着这个市场从“把算法塞进盒子里”走到“让盒子自己会思考”。今天不聊PPT上的概念,就结合我从家用AI摄像头到家庭AI智能体的实际项目经验,聊聊边缘AI市场到底在干什么,哪些是真需求,哪些是伪需求,以及踩过哪些坑。
这篇文章适合正在做边缘计算产品、智能硬件选型,或者准备从云端AI转向端侧方案的开发者。不管你是做摄像头的、做智能音箱的、做家居中控的,还是单纯对边缘AI感兴趣,都可以从里面找到一些能直接用的东西。
1. 边缘AI到底在解决什么问题
1.1 为什么非要把AI从云端搬到本地
先说一个最核心的问题:边缘AI到底解决什么?答案就三个词——时延、带宽、隐私。
我做家用摄像头项目的时候客户提过一个需求:检测到老人摔倒要在1秒内推送告警。云端的方案是摄像头持续把视频流推到服务器,服务器跑完算法再传回结果。这个链路在家庭宽带上实测下来,顺利时2秒左右,网络一波动5秒、10秒都出现过。而且用户家如果用的是弱运营商网络,上行带宽根本扛不住持续推流。如果把模型直接部署在摄像头的芯片上,视频帧在本地就能完成推理,告警延迟能压到300毫秒以内。
再说带宽成本。一个1080P摄像头,H.264压缩后码率大概2-4Mbps,一天产生30GB左右的数据。如果所有数据都要上云,流量费和存储费用非常吓人。边缘AI的方案是本地先做结构化,只把“有人经过”“猫在客厅”“快递放在门口”这些事件结果传上去,一天下来可能只要几百KB。
隐私问题就更敏感了。家庭场景里,摄像头拍到孩子的画面、卧室走廊的走动,这些数据一旦上云就面临泄露风险。边缘AI让视频数据根本不出设备,只在设备内部完成识别,用户会安心很多。这也是为什么欧盟的GDPR、国内的个保法出来之后,很多摄像头厂商开始转向端侧方案。
1.2 边缘AI的“边缘”到底在哪里
很多刚接触的人会把“边缘”理解成一个模糊的地理位置概念,其实边缘AI里的“边缘”是指数据产生的位置到云端数据中心之间的这段距离。边缘可以是一个摄像头、一个路由器、一个智慧屏、一台工控机,甚至可以是一个MCU。
从实际部署角度看,边缘设备分几个层级。第一层是终端设备,比如AI摄像头、智能门锁、猫眼,算力在0.5-2 TOPS,主要跑轻量级分类和目标检测。第二层是家庭/小型边缘网关,比如带NPU的路由器、智能音箱、家庭服务器,算力在3-10 TOPS,可以做多路视频分析和简单的自然语言处理。第三层是边缘服务器,比如小区机房里的AI盒子、园区边缘节点,算力更高,适合做联邦训练和跨设备协同。
我做家用AI摄像头时用的是第一层,后来做家庭AI智能体时,算力需求升到第二层,因为要跑语音识别、意图理解、视觉感知等多个模型。这个算力分层的概念很关键——它决定了你的产品形态、芯片选型和成本结构。
1.3 市场驱动力:算力、模型、场景三波浪潮
边缘AI这波爆发不是单一因素推动的,我把它拆成三波浪潮。
第一波是端侧算力的大幅提升。过去想在摄像头里放一个神经网络,只能用高端的安霸、海思芯片,成本高得离谱。现在瑞芯微RK3588这种级别的SoC,8K视频硬解加上6T算力NPU,几百块钱就能买到开发板。算力从“不够用”到“够用且便宜”,这是最基础的地基。
第二波是轻量级模型的发展。YOLOv5n、YOLOv8n这种模型,在COCO数据集上MAP能到30-40,但参数量只有3-4M,INT8量化后模型体积只有几MB,在一颗2T算力的芯片上能跑30FPS以上。再到后来出现的一些更小的大语言模型,比如Phi-3-mini、Qwen2.5-0.5B,让边缘设备也能跑得动语音理解和推理。
第三波是场景成熟。家庭安防、看护老人小孩、宠物监测、快递看护这些场景,用户付费意愿清晰,愿意为“智能”买单。这三波叠在一起,边缘AI才真正从实验室走进产品。
2. 家用AI摄像头是怎么从“看得见”变成“看得懂”的
2.1 传统摄像头与AI摄像头的核心差异
传统摄像头做的是“采集+编码+存储+回放”,本质上是一台录像机。AI摄像头在链路里增加了感知和理解环节,它要做的是“采集+识别+理解+决策”。
举个例子。传统摄像头拍到家门口有个人,它只能记录下一段视频,需要你自己去看回放。AI摄像头能做到:识别出这是陌生人、判断是路人经过还是停留、检测到人脸并提取特征、跟云端的数据库做比对、如果发现是黑名单人员就触发声光告警,同时把告警消息推送到你的手机。这个过程从“被动记录”变成了“主动感知”。
技术上最大的区别在于:传统摄像头跑的是固定逻辑的ISP、编码器,AI摄像头需要一颗可编程的NPU或GPU来执行神经网络推理。这颗芯片决定了摄像头的AI能力上限。我踩过的坑就是在选型时只看了CPU频率和编码能力,忽略了NPU的利用率,结果模型勉强能跑但帧率惨不忍睹。
2.2 端侧模型部署的完整流程
把一个人脸检测模型部署到摄像头芯片上,整个过程远不止写代码那么简单。
首先是模型选型。家用摄像头场景里,人脸检测模型通常用轻量化的YOLOv5n或者SCRFD,输入分辨率控制在640x640以内。分辨率越高,精度越好,但推理时间会线性增长。实测下来,在瑞芯微RK3588上跑YOLOv5n,640输入大概需要15-20ms,320输入只需要5-8ms,但小目标检测能力下降明显。项目里需要做平衡,我通常会保留双分辨率模式——平时用320做快速人体检测,检测到人体后再用640做人脸识别,既保功耗又保精度。
然后是模型转换。PyTorch训练出来的模型不能直接在NPU上运行,需要先转成ONNX,再通过芯片厂商的工具链转成NPU格式。瑞芯微的工具是RKNN-Toolkit2,地平线是OpenExplorer,这个过程会出现大量兼容性问题:有些算子不支持、量化精度掉点、模型结构太复杂导致转换失败。遇到过最典型的问题是Softmax算子在某些NPU上用CPU浮点方式运行,速度慢几十倍,需要把模型改成走全连接层前输出结果,或者用Sigmoid替代。
接着是量化校准。INT8量化能把模型大小压缩到原来的1/4,推理速度提升2-3倍,但精度会有损失。量化时需要准备几百张有代表性的校准图片,覆盖白天、黑夜、逆光、侧脸等场景。校准集选得不均匀,模型在某个光照下会突然大量误检。我在项目里遇到过夜间模式全部失效的bug,排查下来就是校准集里夜间的样本太少。
最后是部署和调优。推理框架负责管理NPU的内存分配和任务调度,要小心内存对齐和缓冲区生命周期的问题。摄像头是7x24小时运行的,内存泄露跑几天就会把设备拖垮。我们当时做7天压力测试跑出40多MB的内存泄露,最后定位到一个事件回调里没释放图像缓冲区的引用。
2.3 隐私保护在端侧怎么落地
端侧AI一个天然优势就是隐私保护,但实际落地没那么简单——“不上云”只是基础,产品上要把隐私保护设计成用户可感知、可控制的功能。
我现在做的方案是在摄像头里加一个AI隐私遮罩:检测到人体的包围盒之后,原始视频流中除了人体框内区域,其他大面积的背景画面都用马赛克或黑幕遮掉。录像文件里存的是处理后的画面,原始画面只在本地内存里存在几十毫秒。这样即使设备被破解或者SD卡被人拔出,也拿不到用户家里的完整生活画面。
另外一个隐私功能是敏感区域的定向屏蔽,比如卧室门口、卫生间门前,用户可以在地图上画一个区,区域内一旦检测到有人进入就触发告警,但不会上传任何画面。技术实现用的是区域Mask和检测结果做交集判断,没什么难度,但产品意义上非常重要。
隐私这块做得越扎实,用户对AI摄像头的接受度越高。这也是边缘AI相对纯云方案的差异化价值——不是靠算法跑分说话,而是靠“数据根本不出门”这套逻辑打动用户。
3. 从单点设备到家庭AI智能体
3.1 家庭AI智能体到底是什么
家用AI摄像头只是一个单点功能,相当于一个只会做一件事的传感器。家庭AI智能体是把多个边缘设备联动起来、统一调度、具备自主决策能力的一个系统。
打个比方:AI摄像头是“眼睛”,智能门锁是“手臂”,智能音箱是“耳朵和嘴”,家庭智能体就是“大脑”——它接收所有感知设备的数据,做统一的理解和决策,再去调度其他设备执行动作。
比如这样一套场景:早晨7点,门锁检测到有人出门,摄像头识别出是家庭成员,智能体根据日历判断今天有早会,于是通过音箱提醒“今天9点有个线上会议,外面在下雨,记得带伞”,同时给扫地机器人下发指令“主人出门了,开始清扫卧室以外区域”。每个设备各自只能做感知或执行,但它们共享同一个“大脑”的决策,这就是智能体比单点智能高级的地方。
我2023年开始做这个方向的时候,市面上的产品还停留在“自动化规则”阶段,比如“如果有人经过,就开灯”。本质上是硬编码的联动,没有理解能力。真正的智能体需要理解语义、感知上下文、自主规划任务。到最近两年,随着端侧大语言模型的出现,这件事才真正有了落地的技术基础。
3.2 端侧大模型和小模型的分工
家庭智能体的核心矛盾是:大模型能力强,但资源需求高;小模型资源占用小,但能力有限。我的做法是大小模型协同。
语音唤醒、声纹识别、关键词抽取这些对时延要求极高的任务,用小模型在本地实时跑。意图理解、多轮对话、任务规划这些复杂任务,用一个精简版的端侧大模型来跑。当端侧模型的置信度不够时,再走云端大模型做兜底。
我做了一个三级推理架构。第一级是本地即时响应,延迟目标小于100ms,处理简单的命令词和状态查询,比如“客厅灯打开”。第二级是本地综合推理,延迟目标在1-2秒内,在端侧跑3B-7B参数的小语言模型,可以理解“我出门了,把家里安防布防”这种带上下文的指令。第三级是云端复杂推理,只有端侧判断需要更多知识时才调用,比如问“有什么适合三岁小孩吃的晚餐建议”。这个设计把90%的请求留在本地,成本、隐私和体验都得到了保证。
选择端侧大模型时要重点看几个指标:参数量、上下文长度、部署显存、首Token延迟、支持的量化格式。我实测过Qwen2.5-3B的INT4量化版本,在RK3588上首Token延迟在1.2-1.8秒之间,在可接受范围内,但再大一点的模型就会出现明显的卡顿感。
3.3 家庭智能体的关键技术实现
家庭智能体的完整技术栈包括感知层、理解层、决策层和执行层,每层都有具体的实现细节。
感知层就是各种传感器加AI算法,包括视觉、语音、环境传感器数据。这里的关键是数据融合——不同设备的数据需要在时间轴上对齐。摄像头检测到“有人”的时间戳、门锁检测到“开门”的时间戳、音箱接受到语音的时间戳,偏差要控制在100ms内,否则智能体容易把两件事误判成因果关系。我做了一个轻量的数据分析管道,维护一个最近10秒的事件窗口,按设备优先级做合并策略。
理解层要把多模态数据转成结构化的事实。比如摄像头输出“客厅里有一个成年男性”,语音识别输出“家里有人吗”,智能体要把这两个信息统一成“客厅存在一个人员,语音入口有询问请求”,再结合家庭成员数据库判断这个人是家庭成员的可能性。这里用到的基础设施是一个轻量的实体识别模型,配合规则引擎做槽位填充。
决策层是智能体的核心。我采用的是“意图识别+状态机+策略模板”的组合方式,没有一上来就依赖纯大模型决策。先定义好家庭场景的状态集合:在家、出门、睡觉、离家布防、来客、异常。每个状态定义好可以执行的动作组。大模型负责的是自然语言的意图抽取,策略模板负责具体的执行路径,最后通过一个调度器把动作分发给各个设备。
执行层的核心是设备控制协议。家庭设备用的协议五花八门:WiFi直连、蓝牙Mesh、Zigbee、Matter。智能体要做一层协议适配层。我项目里做的是基于Matter协议接入主流智能家居生态,同时保留了Home Assistant作为后备方案,通过HTTP Webhook输出控制指令。
3.4 家庭智能体和云端智能体的边界划分
到底哪些功能留在本地,哪些上云,这是做家庭智能体产品定义时最难的问题。我的划分原则是看四个维度:时延敏感度、隐私级别、数据量大小、模型能力需求。
时延敏感的任务比如语音唤醒、摔倒检测、入侵告警,必须留在本地。隐私级别高的数据比如室内视频、人脸特征、语音内容,优先本地处理。数据量大的任务比如全天录像的结构化分析,本地先做一遍粗筛,只有异常片段才考虑上云。模型能力需求高的任务比如开放域知识问答、复杂推理,只能云端大模型做。
这个边界不是固定的。随着端侧芯片算力的提升和更小更聪明的大模型出现,很多原本必须上云的任务一步步往边缘迁移。今年我跑通了在边缘网关设备上直接跑涉及常用工具调用的智能体推理流程,把代码解释和结构化查询这类任务也拉到了本地。这件事一个月前还做不到,因为端侧模型理解复杂指令的能力不够,现在能做了是因为新发布的模型在工具调用指令遵循上提升很明显。DeepSeek公开的智能体训练新方法也提到,通过自我反思和反馈学习的训练策略,可以用较少的参数让智能体自主决策和调用工具的准确率大幅提升。这说明模型训练方法的进步正在给边缘设备赋能,让“小模型也能干复杂活”。
4. 边缘AI市场在干什么
4.1 市场玩家分层的真实图景
边缘AI市场按产业链位置可以分成几层,每层玩家做的事情完全不同。
芯片层是最上游的。国际上有高通、英伟达、AMD,国内有瑞芯微、地平线、海思、晶晨、全志。这个层级的核心是提供在特定功耗范围内满足AI算力需求的SoC,比拼的是NPU架构效率、工具链成熟度和生态丰富度。我用了这么多芯片平台后最大的感触是:芯片算力参数是纸面实力,真正决定开发效率的是工具链的完善程度和开发者文档的质量。
模组和方案商做的是把芯片做成标准化产品,比如AI摄像头模组、边缘计算盒子。它们解决的是下游企业“没有能力做硬件设计”的问题。中小型硬件品牌通常会直接采购模组,自己只做外壳、App和品牌运营。
算法和模型层提供的是端侧模型、模型压缩工具和部署框架。传统AI公司比如商汤、旷视也布局了端侧SDK,开源社区有ONNX Runtime、TensorRT、TFLite这些推理引擎。这一层的关键能力是做模型在特定芯片上的极致优化。
应用层直接面向终端用户,像家用AI摄像头、智能门锁、宠物喂食器、陪护机器人。这一层的关键不是技术多牛,而是场景定义准不准、用户价值是否成立。我见过太多技术很强但卖不出去的AI产品,问题都出在这一层——把“能做的东西”当成了“用户需要的东西”。
4.2 从热搜词看边缘AI的技术风向
最近被反复讨论的几个热搜词很能说明问题,我逐个说说自己的理解。
DeepSeek公开AI智能体训练新方法,这被很多人误解为独占技术,但它对边缘AI有真实的示范效应。传统智能体训练依赖海量人工标注的问答对,DeepSeek的方法重点在智能体通过环境反馈来优化推理策略,降低了对人工标注的依赖。这意味着部署在边缘设备上的智能体也有机会通过用户的实际使用反馈来持续优化,而不仅仅是出厂时训练一次就固定下来。
扣子这类平台被高频使用,说明AI智能体的开发正在从“写代码”变成“搭积木”。扣子让我印象最深的是预置了非常多的工作流节点,你可以用自然语言描述任务,平台自动编排流程。对边缘AI开发者来说,这类平台的价值在于可以快速验证智能体逻辑,然后再把验证过的流程搬到端侧做轻量化部署。我目前在新项目里就先把家庭智能体的意图处理和任务编排逻辑在扣子上跑通,再移植到端侧,开发效率提升了不少。
华为云码道检视修复智能体这种垂直场景智能体的出现,验证了一个趋势:智能体一定要跟具体业务场景深度结合。它专注于代码检视、缺陷修复,用AI做代码质量保障,而不是去做一个什么都懂的通才。边缘AI也一样,泛泛的“家庭智能”没人买单,但精确到“用AI看护独居老人”“用AI防止电动车入户”这类细分场景,用户立刻就能感受到价值。市场正在从“我有一个AI产品”走向“我在某个场景里用AI解决了具体问题”,边缘AI产品定义也会有同样的转向。
4.3 边缘AI的商业化模式和盈利路径
边缘AI的商业化并没有很成熟,不同环节的商业模式差别很大。
芯片层走的是传统半导体模式,卖芯片、卖开发板、卖授权,靠出货量赚钱。这个模式关注的是大客户的标杆案例和生态系统的开发者数量。模型和算法层则两种模式并行:一种是卖SDK授权收License费,一种是按设备数量抽成,像每台设备收几块钱的算法授权费。应用层最灵活,可以卖硬件赚硬件差价,也可以卖订阅服务赚持续收入,比如家庭安防的云存储订阅、AI守护服务的月费。
我自己在应用层做项目时发现一个很重要的规律:纯硬件的一次性买卖很难支撑持续的研发投入,因为AI算法需要持续迭代。订阅制才是AI硬件产品的合理商业模式——用户首年买硬件,后续按年支付AI服务费,厂商才有资源持续优化模型和增加新功能。但这要求产品体验必须好到用户愿意持续付费,否则很容易出现第二年大量掉订阅的窘境。
边缘AI环境的巨大差异带来一个天然问题:同一套产品适配不了所有部署环境,这是拼服务能力的差异化空间,也是商业模式的机会。
4.4 边缘AI与云AI不是替代关系
很多人会把边缘AI和云AI对立,这个认知是错误的。我做项目的实际感受是:边缘AI和云AI是互补关系,两者组合起来才能形成完整的产品能力。
边缘AI强在即时、私密、低成本,云AI强在聪明、知识广、算力大。一个成熟的AI产品应该是“边缘+云”协同工作的混合架构。边缘负责实时响应和隐私保护,云负责复杂推理和全局限期优化,中间通过一套统一的管理平台把两者衔接起来。
举例说明:我的家庭智能体在本地完成了“人物识别”“摔倒检测”“意图理解”,但是当家庭成员提出一个知识性的问题,比如“这个季节适合种什么花”,本地模型答不了,就通过加密通道发给云端大模型处理。云端处理完后,把结果摘要发回本地,由本地音箱语音播放。用户只会感受到“AI很聪明且响应很快”,不会在意是本地还是云端处理的。架构对人的体验是透明的。
这类“边缘+云”协同的架构,在实际产品里越来越成为标准配置。边缘AI市场要做的事情不是取代云AI,而是把云AI的能力延伸到终端附近,让智能不再受网络和延迟的制约。
5. 做边缘AI产品最容易踩的坑
5.1 选芯片不能只看TOPS数值
很多硬件团队上来就问“这颗芯片几TOPS”,但TOPS只是理论算力,真正决定体验的是NPU利用率。我测过同一颗芯片,跑不同结构的模型,帧率能差出5到10倍。还有一批芯片标注的TOPS是INT8稀疏算力,实际普通模型根本达不到。
选芯片时我会综合看六个维度:芯片的NPU利用率、内存带宽、工具链成熟度、算子的覆盖率、量产价格和供货周期、生态社区活跃度。网上有些评测文章会给出芯片在常见模型上的实测帧率和功耗,比官方PPT可信得多。如果找不到现成数据,最快的验证方式是买开发板跑一周真实负载,用模型跑起来看温度和帧率曲线,比什么都准。
5.2 模型量化别只看精度指标
模型量化是边缘AI部署中最常见的坑。很多人拿着量化前后的MAP对比,精度只掉了1%就觉得万事大吉,但一到真机测试就出问题。因为MAP量的是整体统计指标,它反映不了具体场景的退化。
我在家用摄像头项目里做INT8量化后,全局精度看起来没明显变化,但发现两个极端问题:一是夜间小目标检测几乎失效,二是对戴帽子者的检出率下降很大。原因是这两种样本在校准集会严重不足,分布又不均匀。校准集要充分覆盖各种真实光照、姿态、遮挡情况,而且不能只看最终的平均精度,一定要按场景维度分别评估。
如果某些场景怎么量化都掉点,一个保底方案是混合精度或选择性量化:把敏感层的权重量化成INT8时改用FP16存储,增加的开销很小,但能挽回这类场景的精度。这个方案在工程实践中的效果比反复调校准集更显著。
5.3 功耗和散热是家用设备的隐形红线
家用摄像头是7x24小时通电的,功耗不是产品参数上随便写写的数字。我见过很多好用的功能最终被砍掉,就是因为整机功耗超标。
边缘AI推理芯片高负载时的功耗比纯视频编码高出很多,需要足够的散热设计。家用摄像头外壳大多是封闭塑料,散热环境很恶劣。我们实测过RK3588满载跑AI推理时,塑料外壳表面温度能到70度以上,夏天会烫手,这会带来巨大的退换货风险。
功耗优化的核心是让NPU只在需要时才全速运转。我的方案是使用触发式推理机制:人形检测在低帧率(比如3FPS)下运行,检测到人形后立刻切换到高算力的识别模型,任务完成后NPU降频。这种模式下,平均功耗能降低40-50%,设备温度控制在合理范围内。
5.4 算法硬件同步验证,别等产品成型再调
在算法团队和硬件团队只有两个角色时,最容易踩的坑是分工过晚。我的一点经验是:算法选型、硬件选型和结构设计一定要同步启动。
如果等产品结构设计做完了才选算法,你会发现自己想要的模型在选定的芯片上跑不动,或者跑得了但发热太大,最后只能换芯片或者砍功能。正确流程是先选好3款备选芯片,把算法的工程Demo在开发板上跑起来,看帧率、延迟、功耗、内存占用,同步根据Demo板的尺寸去规划产品结构,等这些都验证通过之后,再进入正式的结构设计和量产打样。
5.5 常见问题与排查技巧实录
| 问题现象 | 可能原因 | 排查思路 |
|---|---|---|
| 模型转换报算子不支持 | NPU算子覆盖不全 | 查看算子支持列表,替换为等价算子结构,比如把注意力模块改成正则卷积 |
| 量化后夜间检测失效 | 校准集夜间样本不足 | 按场景维度重新组织校准集,加入夜间、逆光、强噪声样本 |
| 推理偶尔卡顿几十秒 | 内存碎片导致分配失败 | 开启内存池,排查缓冲区泄漏,做7x24小时压力测试 |
| 多路视频叠加推理掉帧 | NPU并发调度冲突 | 用异步推理接口,将预处理/后处理和后处理放到CPU核并行 |
| 设备连续运行几天后变慢 | 内存或句柄泄漏 | 逐步关闭功能模块定位,做增量日志审计 |
| 功耗比设计目标高出30% | NPU空闲时钟没降 | 配置调频调压策略,空闲时关闭NPU电源域 |
排查这类问题时,一定要分级定位:先确认问题出在硬件、驱动、算法还是上层应用层。不要一上来就怀疑算法,我见过最冤枉的一次——型号对了但推理库版本过旧导致兼容问题,不是算法的问题也不是芯片的问题,纯工具链版本的坑。
6. 边缘AI还能走多远,个人方向的建议
6.1 端侧大模型的大门才刚推开
2023年的时候,在边缘设备上跑大语言模型还被当成笑话。短短几年时间,3B-7B参数的模型经过量化已经能在消费级芯片上流畅运行,这个进步速度远比大多数人预想的要快。
OpenAI公布过一个大模型和推理能力的演进路线,未来两年端侧模型的能力上限还会显著提高。芯片算力提升一倍的背景下,边缘设备可以跑更大的模型、更多路感知任务。家庭AI智能体从“听得懂简单指令”进化到“理解家庭上下文、预判用户需求”,这个路径已经清晰可见了。
6.2 对从业人员的一些实在建议
如果准备入局边缘AI,我给几条实际建议。
一是重视工具链生态,甚至要在重视程度上高于芯片性能本身。一些冷门芯片的AI算力参数很亮眼,但它的工具链两个月出一个大版本、每个版本都在变,团队会被耗死在迁移适配的泥潭里。
二是把场景想得越具体越好。“家庭智能”做起来很难定义边界,但“用AI看护独居老人,异常时通知子女”这个场景明确得多。场景定义清楚了,技术选型、数据采集、测试标准都会随之清晰。
三是尽早建立端云协同的产品思维。纯端侧会受限于模型能力,纯云端会受限于时延和隐私,只有两边配合才能做出体验最好的产品。很多项目一开始就决定“全部本地处理”,后来发现用户问的问题一个都答不上来,最后被迫架构重构,代价非常大。
我在实际项目里最大的感受是:边缘AI市场正在从“概念验证”走向“规模落地”,但这并不是让所有人都去追好看的DEMO,而是谁能在成本、功耗、体验之间找到平衡点,谁就能在垂直场景里站住脚。2018年我刚开始做边缘AI摄像头时,经常要花大量时间去说服客户,跟客户解释为什么本地识别比云端识别更靠谱;到现在客户会主动问端侧方案支不支持、功耗是多少、能不能给SDK。这个市场确实是肉眼可见地在成熟,机会也越来越多。
最后再分享一个小技巧:做边缘AI项目时,把“用户愿意在什么条件下为这个功能付费”这个问题想清楚,比任何技术选型都重要。技术上的难题,大部分都能靠持续迭代解决;但产品没有清晰的付费价值,技术再领先也走不远。我这几年的经验是先从一个小功能切入,验证市场和用户接受度,再慢慢扩展功能面,稳扎稳打往前走,比一上来就做一个“全家桶”式的智能体要靠谱得多。