2026年,端侧AI规模化落地正在重塑自动售货机行业的技术架构。传统云端推理方案在延迟、带宽和隐私合规方面的瓶颈日益明显,而端侧AI方案正快速成为行业标配。本文基于RK3588平台和YOLOv11n模型,从模型转换、量化优化到推理部署,完整复盘自动售货机AI视觉开门柜的工程落地过程,特别聚焦YOLOv11在RKNN量化中的核心难题——坐标框与得分取值范围差异导致的量化失败问题,并给出经过验证的工程解法。
一、为什么选择RK3588作为端侧AI平台
自动售货机AI视觉开门柜需要同时满足高算力AI推理和丰富外设接口的双重约束。RK3588作为瑞芯微旗舰级AI SoC,凭借6 TOPS NPU算力和丰富的接口资源,成为当前自动售货机行业端侧AI的主流方案。
核心规格:RK3588采用八核处理器(4乘A76加4乘A55),内置三核NPU架构,支持INT4、INT8、INT16、FP16等多种精度运算。6 TOPS的NPU算力足以在本地完成YOLO系列模型的实时推理,无需将视频流上传云端。
外设接口:开门柜需要连接4路以上摄像头(通过MIPI-CSI接口)、每层货架配备重力传感器(I2C或ADC读取)、电子锁(GPIO控制)、玻璃门加热除雾模块,以及扫码、NFC、刷脸等多支付模块。RK3588提供的多路MIPI-CSI摄像头接口、RS232和RS485串口、GPIO、HDMI和LVDS显示输出,刚好覆盖这些需求。
为什么不用云端方案:云端推理延迟150到800毫秒,在网络拥堵场景可能升至800毫秒以上,直接破坏无感体验。端侧推理将延迟降至10到50毫秒,用户关门瞬间即可完成识别。同时,端侧方案单柜月流量从30到100GB降至2到5GB,原始图像数据不上云,规避了隐私合规风险。
二、YOLOv11n部署的核心问题:量化友好性
在将YOLOv11n部署到RK3588的NPU时,最大的挑战不是模型精度,而是INT8量化。
问题现象:按照YOLOv11官方导出的ONNX模型直接转换成RKNN的INT8模型后,检测不到任何结果。打印模型输出发现,输出张量的84个维度中,前4个坐标框值正常,但后80个得分输出全为0。
根因分析:坐标框值的取值范围是1到640,而得分输出的取值范围是0到1。两者取值范围差异巨大,当它们被concat在一起时,INT8量化无法同时照顾这两种数值分布,导致得分输出在量化后全部变成0。如果转RKNN时不进行量化(保持FP16),输出结果正常,但推理速度达不到量产要求。
三、七种部署方法的对比与最优解
针对YOLOv11n在RK3588上的部署,业内已有系统的优化探索。以下7种方法的对比数据基于RK3588平台、YOLOv11n模型、输入分辨率640乘640:
方案一:官方导出模型直接部署。模型结构保持官方导出格式,输出直接是类别和解码后的框。INT8量化完全不可用,检测不到任何结果。这是量化友好性最差的方案。
方案二:去掉最后的concat操作。在方案一基础上去掉坐标框和得分concat在一起的操作。INT8量化能正常输出,但板端检测效果不理想。
方案三:去掉坐标框解码。在方案二基础上进一步去掉坐标框解码到模型输入尺寸的计算。检测效果仍有问题,但已开始改善。
方案四:去掉坐标框的DFL。在方案三基础上继续去掉坐标框的DFL(Distribution Focal Loss),输出2个头。检测效果没有明显问题,这是第一个能正常工作的方案。
方案五:去掉split和sigmoid。在方案四基础上去掉坐标框和得分进行分开的split操作,以及得分的sigmoid函数,输出1个头。检测效果正常,后处理不再增加CPU占用。
方案六:去掉三个检测头的concat。在方案五基础上把三个检测头concat在一起的操作去掉,输出3个头。推理时耗进一步降低,量化友好性更好。
方案七:去掉所有concat。在方案六基础上把三个检测头的坐标框和得分concat操作全部去掉,输出6个头。模型速度达到最快,量化友好性达到最好。
量化友好性的核心规律:随着解码操作越来越多地从模型中移除、移到后处理中执行,模型的推理时耗在减少,量化效果也在逐步变好。
四、工程落地时的性能权衡
当NPU负载不是瓶颈时,可以考虑把更多操作放在NPU上执行;反之,当量化掉点较多时,则应选择量化更友好的方案。
校准数据集质量至关重要:量化校准需要200到500张图像,覆盖白天自然光、夜间LED补光、用户手掌遮挡等各种实际场景。如果校准图像覆盖不全,部署后夜间识别准确率可能下降5到8个百分点。
实际效果:采用方案七后,INT8量化模型在RK3588上的推理时耗降至30毫秒左右,后处理时耗约7毫秒,总时耗控制在40毫秒以内。加上重力感应辅助校验后,整体端到端识别准确率可稳定在98%以上。
五、自动售货机场景的三个特有工程坑
坑1:夜间低光照下的识别精度下降。自动售货机常部署在户外或室内角落,夜间只有LED补光。解决方案是在训练数据中加入低光照增强样本,同时通过RK ISP的tuning工具调整白平衡和曝光参数。这一步不做,识别准确率至少掉5个百分点。
坑2:商品密集遮挡导致漏检。货架上瓶装水紧挨着摆放,用户伸手取货时手掌遮挡部分商品。纯视觉方案容易出现漏检。引入重力感应辅助校验,视觉识别结果与重量变化交叉验证,两者一致才确认交易。这也是目前行业主流设备采用“AI视觉加重力感应”双重识别方案的原因。
坑3:持续运行导致NPU过热降频。24小时连续运行,NPU长时间高负载推理会导致芯片温度升高触发降频。解决方案是推理负载均衡与硬件散热优化并行。
六、总结
YOLOv11n在RK3588上部署的核心经验:
量化友好性是关键:坐标框与得分的取值范围差异是量化失败的根本原因。最优解是将解码操作移出模型,模型只保留最本质的特征提取部分,解码全部放到后处理。
校准数据集决定最终精度:必须覆盖实际部署场景的各种光照和遮挡条件。
端侧AI部署的工程落地,80%的精力都在处理转换、量化和边界情况。模型精度反而是最好解决的问题。
目前,这套端侧AI方案已在自动售货机行业部分头部设备制造商的产品上完成量产验证,采用AI视觉加重力感应双重识别方案,识别准确率不低于98%,支持5000多种商品精准识别;自研SaaS后台管理系统支持远程改价、实时库存监控、故障自检报警等78项功能,系统终身免费升级,设备联网无流量费用、0算力费、0平台费;产品已出口至全球100多个国家和地区,售后网络覆盖国内外600多个城市、30000多个网点,由PICC承保;弹簧机2999元起,开门柜1999元起,提供包卸车、包入户服务。
本文基于行业公开信息与技术调研整理,仅供参考。