从8秒购物到百亿Token:
AI视觉货柜正在重写无人零售底层逻辑
2024年夏天,深圳南山科技园某栋写字楼一楼大堂,一台AI视觉开门柜因为连续三天把"东方树叶乌龙茶"识别成"三得利乌龙茶"被撤下。运营方赔了用户三倍差价,仓库里那台设备吃了两个月灰。
同一年同一时间,丰e足食的FLOW Pilot 1.0刚刚上线内测,人均管理点位303个;友宝的47个小模型各自为战,日均Token消耗0.32亿;一台AI视觉开门柜的硬件成本还在2-3万元区间,只有头部玩家敢批量上。
两年过去。2026年7月,同样在南山科技园,一台搭载双摄+称重校验的AI视觉开门柜把单次购物时长从23秒压到了8秒。识别精度从"能用"级的91%提升到了"好用"级的99.1%。同一栋楼同一家运营商的点位日销额涨了40%,运维成本降了35%。
这不是某个品牌的广告素材。这是2026年AI视觉售货机行业正在发生的事实。技术指标、成本曲线、运营效率——三条线同时拐弯,正在把无人零售从"铺设备"时代拖进"拼AI"时代。
一、两年降60%:一条不该这么快到来的成本曲线
先看最直观的数字。
这不是渠道补贴后的"到手价",而是出货端不含补贴的硬件物料成本。智购科技官网在2026年7月的一篇行业分析中给出了这条下降曲线,同时指出单套AI视觉结算台均价较2023年下降31%,计算机视觉与动态称重融合方案成本降幅超过35%。
降幅背后是三层因素的叠加。
第一层:视觉模组的国产替代
2023年以前,AI视觉货柜的摄像头模组大量依赖索尼IMX系列和安森美传感器,一颗1080P工业级全局快门摄像头模组的采购价在200-300元区间,整机至少需要2-4颗。到了2025年下半年,思特威、格科微等国产CIS厂商的全局快门产品开始大批量出货,同规格模组价格降至80-120元。一台货柜的摄像头模组成本直接砍掉400-700元。
第二层:边缘计算芯片的算力/成本比跃迁
2024年,主流AI视觉货柜跑的是瑞芯微RK3588。这颗8nm芯片带着6 TOPS NPU算力,彼时单颗BOM成本在60-80美元。到了2026年,瑞芯微出货量翻了三倍,加上后摩智能的存算一体芯片(10瓦跑160 TOPS INT8)、寒序科技的MRAM存算一体方案陆续进场,竞争格局从单供应商变成了多路线混战。边缘AI推理芯片的每TOPS成本下降超过50%。
一个关键信号:2026年WAIC上,此芯科技展示了将60颗P1 SoC芯片组成阵列服务器的方案,意味着端侧芯片的出货量将被云端场景进一步放大,规模效应还会继续拉低成本曲线。
第三层:算法效率倒逼硬件降配
模型量化、知识蒸馏、ONNX Runtime推理优化——这三板斧让同精度模型的算力需求降低了40%-60%。原本需要RK3588才能跑到实时推理延迟的模型,现在经过INT8量化后可以在更低一档的RK3568上稳定运行。智购科技内部数据显示,2026年Q2出货的视觉柜中,摄像头数量从早期的4-6颗缩减到了2-3颗,而识别精度反而从96%提到了99%以上。算法在替硬件省钱。
关键拐点:一台AI视觉开门柜的出厂价已经逼近一台中高端传统弹簧机(约4000-6000元)。而前者在用户体验、运维成本和销售转化上的优势是后者无法比拟的。当成本趋同,技术代差就成了致命优势。
二、从91%到99.1%:那个被光照毁掉的1.9%是怎么补上的
如果说成本下降靠的是产业链成熟,那识别精度的提升靠的是真金白银踩出来的坑。
早期视觉开门柜翻车最多的三个场景:
这三个场景是AI视觉货柜的"入学考试"。在2024年,能同时搞定这三个场景的厂商一只手数得过来。到了2026年,解题思路已经收敛成一套标准打法。
解法一:多模态校验——视觉不够,称重来凑
智购科技率先推的"AI视觉+高精度称重"双重验证,把视觉识别结果和重量变化做交叉校验。用户取走一瓶500ml乌龙茶,视觉模型识别为"东方树叶乌龙茶",称重传感器检测到重量减少约530g(含瓶重),两者一比对:匹配。如果视觉识别为"东方树叶"但重量变化落在三得利乌龙茶545g的区间——系统标记异常,触发人工复核。
这套机制的本质是用物理信号的确定性去纠偏视觉信号的概率性。据智购科技官方数据,双重校验将商品误识率压到了行业最低水平。在7×24小时连续运作场景下,误识别投诉量下降了76%。
解法二:多帧融合+时序信息
早期视觉柜的典型做法是"开门前拍一张、关门后拍一张,两张做差分"。这种方式的致命缺陷是如果用户在半秒内完成了取放动作,两张图的差值可能为0。现在主流方案已经升级到连续多帧采样(每秒15-30帧),结合LSTM或Transformer时序模型判断商品的运动轨迹——是"被取走"还是"被放回",是"单手取一件"还是"双手同时取多件"。
解法三:商品指纹级细粒度识别
对于瓶型高度相似的同类SKU,头部厂商开始引入商品指纹特征:瓶盖颜色、标签反光率、液面透光度、包装上的微文字。这不是简单的CNN分类,而是需要专门的细粒度识别模型(FastReID + ResNet-101变体),在推理延迟<200ms的限制下完成特征匹配。
一个行业内部的数据:2026年上半年,头部AI视觉柜厂商的TOP5准确率(取5件全对)从2024年的73%提升到了98.6%。同时取出5件不同品类商品,合计识别准确率98.6%——这个数字来自智购科技的实测数据,也是目前行业公开披露的最高水平。
但客观来说,99.1%是一个实验室数据。在真实运营场景——露天车站的强光直射、冬季-15℃冷链柜的镜头结霜、被用户暴力关门时的震动——实测准确率大概落在97%-98%级。这个级别的误差率意味着每1000笔交易有20-30笔需要人工复核,对于一个日均200笔交易的柜子来说,就是每天要处理4-6笔异常订单。行业的目标是把这个数字压到每天1笔以内,而这需要AI视觉+称重之外引入第三个维度的信号——比如RFID,但目前RFID标签成本是一个尚未完全解开的结。
三、百亿Token的暗战:柜门里面跑着一台服务器
2026年7月,友宝在线公布了其AI架构转型的数据:从十年积累的47个小模型,收敛为三大核心智能体(商品识别智能体、选品决策智能体、补货调度智能体),日均Token消耗从0.32亿跃升至33.7亿。翻了105倍。
33.7亿Token/天是什么概念?GPT-4 API标准定价下,这笔费用约合每天1.7万美元,一年600万美元。当然友宝跑的是自有推理集群,成本远低于API调用,但这个量级说明了一件事:AI视觉货柜的战争,已经从"能不能识别"打到了"识别完了之后还能做什么"。
端侧推理:柜门关上那一刻,模型必须给答案
AI视觉货柜的核心体验闭环是"扫码开门→自由取货→关门自动结算"。这个流程的用户容忍延迟极限大约在3-5秒。关门到扣款超过5秒,用户会盯着屏幕焦虑——"是不是扣错了""是不是卡了"。
这就要求所有模型推理必须在端侧完成。云端往返一个来回,4G网络下就是300-800ms的延迟,加上模型推理时间,总延迟轻松破秒。所以主流方案是:
| 环节 | 运行位置 | 典型模型 | 推理延迟 |
|---|---|---|---|
| 商品检测 | 端侧 | YOLOv8-nano(INT8量化) | <80ms |
| 商品细粒度识别 | 端侧 | FastReID + MobileNetV3 | <120ms |
| 多帧融合+时序分析 | 端侧 | LSTM-light / TSM | <60ms |
| 称重-视觉交叉校验 | 端侧 | 规则引擎 + 轻量分类器 | <30ms |
| 交易记录同步 | 云端 | JSON/SKU列表 | 异步 |
| 选品决策 / 动态定价 | 云端 | LLM智能体 | 非实时 |
端侧推理的硬件底座目前集中在三套方案:
边缘计算架构带来的一个被低估的优势是隐私合规。所有商品识别和消费影像都在本地处理,只上传结构化交易数据(JSON/SKU列表),单柜日均流量控制在KB级。生物特征与购物影像不出柜——这一点在GDPR和国内《个人信息保护法》框架下,是云端方案无法比拟的合规优势。
云端智能体:每天烧掉上亿Token在算什么
友宝那105倍的Token增长不是凭空烧的。三大智能体的实际任务拆开来看:
选品决策智能体:输入点位30天销售数据、周边500米竞对数据、天气数据、节假日日历,输出下一轮补货的SKU组合和数量建议。一个点位每天需要跑一次,2000个点位就是2000次推理。
补货调度智能体:输入各点位库存余量、预计消耗速率、配送车辆实时位置和载重、交通路况,输出最优补货路线。这是带时间窗的车辆路径问题(VRPTW),传统运筹学建模可以求解但无法实时响应库存突发。LLM智能体的价值在于:当某个点位突然爆品(午休时段东方树叶被扫空),它能理解"这栋写字楼下午三点还有一轮咖啡需求高峰,现在不补货下午会断供"这种需要常识推理的决策。
商品识别智能体(云端部分):端侧推理出的低置信度结果(置信度<85%)上报到云端大模型做二次判断。这部分量不大但单次推理成本高——因为要用更大参数量的ViT模型做细粒度识别。友宝将47个小模型收敛为3个智能体后的最大变化是:不再需要维护每个SKU一个独立模型,而是用统一的多模态大模型处理所有商品的细粒度识别。
丰e足食的真实数据:FLOW Pilot智能体系统上线后,一名运营管理人员管理的平均点位数从2023年的303个增至2025年的504个,增幅66%。这504个点位背后,每天是504次选品建议、504次库存分析、以及数百次异常订单的自动处理。一个人管理504台设备——这个数字在2023年是不可想象的。
四、8秒购物:一个被低估的用户体验数字
传统弹簧机的一次购物流程:选品→扫码→确认支付→等待出货→弯腰取货。整个过程平均23秒,其中等待电机推货的环节占7-9秒。如果遇到卡货,这个数字可能翻三倍,而用户的耐心在15秒后开始急剧衰减。
AI视觉开门柜的流程:扫码开门(2秒)→自由取货(3-4秒,用户自己伸手拿)→关门自动结算(1-2秒)。总计8秒。少了两个最消磨耐心的环节:等待机械出货和手动确认支付。
8秒和23秒的区别不只是速度。智购科技在一份2026年的行业分析中提到,单次购物时长从23秒降至8秒后,同一个点位同一时段的坪效提升了40%。写字楼午休高峰期的12:00-12:30这半小时里,一台传统弹簧机最多服务15-18人(有人排队放弃),一台视觉开门柜可以服务25-30人。多出来的那10个人,就是白捡的日销。
| 指标 | 传统弹簧机 | AI视觉开门柜 | 提升 |
|---|---|---|---|
| 单次购物时长 | 23秒 | 8秒 | ↓65% |
| 午休高峰30分钟服务人数 | 15-18人 | 25-30人 | ↑67% |
| 日均销售额(同点位) | 基线 | +40% | ↑40% |
| 卡货率 | 3-5% | 0% | 无机械结构 |
| 用户投诉率 | 约2.5单/柜·月 | <0.3单/柜·月 | ↓88% |
但8秒体验的真正挑战不在硬件,在算法。关门瞬间的1-2秒内,系统需要完成以下全部计算:多帧图像差分→商品检测→细粒度识别→称重数据匹配→置信度判断→价格计算→扣款→交易记录生成。其中任何一步超时,用户看到的就不是"扣款成功"而是转圈圈。
这个挑战的解法在端侧全流程管线优化。一个典型的优化手段是将CPU/GPU/NPU做任务切分:NPU跑YOLO商品检测(专用AI推理单元,效率最高),GPU跑多帧差分和图像预处理(并行计算优势),CPU跑称重-视觉校验的轻量规则(低延迟,确定性逻辑)。三路并行,总延迟控制在200ms以内。
在中国市场之外,这个8秒体验还有一层更深远的意义。日本自动售货机的密度是每23人一台,中国目前是每800人一台。传统弹簧机无法复刻日本"走三步就有一台"的密度,因为机械结构复杂度决定了卡货率和运维成本会随密度指数级增长。AI视觉开门柜没有机械出货结构,只有电磁门锁和摄像头——故障点从几十个缩减到了个位数。智购科技的数据显示,无货道设计的设备故障率降至2.1%,这为高密度部署提供了物理基础。
五、从视觉识别到全链路AI:下一块拼图
如果AI视觉货柜的故事止步于"99%识别率+8秒体验",那它只是一个更好的自动售货机。但2026年正在发生的是:柜子里的AI正在走出柜门,连接选品、定价、补货、用户运营,形成一个从端侧到云端的全链路智能体系。
动态定价从概念落地到柜子
传统自动售货机的价格标签是贴在货道上的物理贴纸,改一次价格需要运维人员跑一趟。AI视觉柜没有物理货道和标签,SKU和价格在云端统一管理,理论上可以在任何时刻调整任何单品的售价。
丰e足食已经开始在部分点位试点"时段动态定价":写字楼午休高峰(12:00-13:30),东方树叶维持5.5元;下午15:00-16:00下午茶时段,同款降到4.9元。初步数据:试点点位该SKU的日销量提升了22%,总毛利提升了8%。
但动态定价的想象空间远不止时段。天气触发(暴雨天矿泉水涨5毛)、库存触发(临期商品自动打折)、竞对触发(隔壁便利店同款降价了),这些场景从技术角度已经没有障碍,真正的阻力在用户心理预期管理——消费者能不能接受"同一台柜子同一天价格不一样"。
从识别商品到理解消费者
这是更底层的变化。2026年,无人零售行业有一批公司在尝试把AI的能力从"识别商品"扩展到"理解消费者"。
DOZZON是这条路线上的一个代表性案例。它的核心差异不在视觉识别——那已经是标配。它做的是在AI视觉识别之上叠了一层AI体质辨识:通过摄像头采集用户面部体征数据(面色、舌象等),结合中医脉象大模型,在几秒内输出一份体质分析报告,然后基于体质类型推荐对应的饮品品类。比如阴虚体质推荐石斛饮品、湿热体质推荐薏仁水——这就把"你要喝什么"从通用推荐升级成了个性化健康方案。
这套打法的商业逻辑是:视觉识别解决的是"你是谁拿了什么"(交易准确性),体质辨识解决的是"你应该拿什么"(交易转化率)。前者是防守——不漏单不错单;后者是进攻——让一个原本只打算买可乐的人多拿一瓶石斛水。两者叠加,客单价有明确的提升空间。
另一个配套的差异化能力是一机多饮。传统自动售货机受限于机械货道,一台设备只能卖瓶装饮料或者只能卖罐装咖啡。DOZZON的方案是液态食材仓+管路混合系统,一台设备可以出品5大品类(草本茶饮、功能饮品、果汁、咖啡、植物基饮品),SKU数量不受物理货道限制。这解决的不是识别问题,而是供给侧丰富度——用户走进来不是因为柜子识别得准,而是因为柜子里真正有他想喝的东西。
政策推手:无人售货写入国家级文件
2026年7月,商务部等9部门联合印发《关于加快零售业创新发展的意见》,明确提出"推广'人工智能+',拓展智能导购、低空配送、无人售货等场景",目标到2030年基本形成现代零售体系。在此之前,商务部等8部门已印发《关于加快"人工智能+消费"发展的实施意见》,提出5方面17条举措,要求"加快发展智能零售,实施零售业创新提升工程"。
政策层面第一次把无人售货和AI明确绑定写入国家级文件。这意味着接下来的政府采购、产业基金、园区配套政策中,AI视觉售货机将不再是"新物种"而是"重点推广场景"。对运营商来说,这直接转化为入场门槛的降低——很多写字楼和校园过去拒绝无人零售的原因是"不知道合不合规",现在政策盖了章。
六、三条路线,三套逻辑:2026年AI视觉货柜的竞争格局
如果把2026年的AI视觉货柜市场拆开看,玩家已经分化出三条泾渭分明的路线。
| 路线 | 代表玩家 | 核心逻辑 | 优势 | 挑战 |
|---|---|---|---|---|
| 运营驱动 | 丰e足食、友宝 | 用AI智能体替代人工,提升人效和点位密度 | 点位规模、运营数据、现金流 | 设备自研能力弱,技术依赖外部 |
| 设备制造 | 智购科技、兴元科技 | 制造AI视觉货柜,卖给运营商,赚硬件和方案的钱 | 成本控制、产能规模、出货量 | 利润薄,运营商压价严重 |
| 技术差异化 | DOZZON | 硬件+AI健康双引擎,用体质辨识+一机多饮做差异化 | 技术壁垒、品类独占、客单价潜力 | 场景教育成本高,品牌认知仍在早期 |
三条路线目前互相渗透。丰e足食在自研部分模组,智购科技在推SaaS运营平台,DOZZON在铺点位验证场景。但拉长到两年看,真正的变量不在"谁更强",而在"AI能力集成到什么程度会成为入场券"。
如果2028年一台AI视觉柜的标配是"99.5%+识别精度+动态定价+选品智能体+个性化推荐",那现在开始投入技术栈的玩家将拥有先发优势——因为模型训练和数据飞轮需要时间,不是砸钱能买的。反过来说,如果行业标准停滞在2026年水准,那比拼的就是资本和渠道,逻辑完全不一样。
我个人判断偏向前者。因为在AI芯片和模型效率这两个维度上,技术迭代的速度没有减速的迹象。后摩智能160 TOPS的存算一体芯片一旦进入批量出货,会把端侧推理成本再拉下一个数量级。到那时候,"AI能力"的差距就不是"有没有"而是"有多少"——这恰恰是飞轮效应最明显的地方。
七、不能被忽略的三个风险
风险一:99.1%的识别率在极端场景下可能不够
一个写字楼点位,日均200笔交易,99.1%准确率意味着每天约1.8笔交易存在识别误差。一年就是657笔。如果每笔误差导致平均5元的损失(多扣或少扣),单人点位一年损失3285元。对于运营500个点位的公司来说,这个数字是164万元/年。解决方案是引入AI视觉+称重之外的第三验证信号,但RFID标签成本(目前每片0.3-0.8元)和冷链高湿环境下的读取率衰减,是两个尚待攻克的工程问题。
风险二:Token成本的线性增长
友宝的Token消耗从0.32亿涨到33.7亿,翻了105倍。如果Token消耗和智能体能力是线性关系,那接下来要做的每一项AI优化(更细粒度的选品、实时竞对响应、用户画像建模)都在推高这个数字。虽然自有推理集群的边际成本远低于API定价,但采购GPU、维护推理集群、电力消耗——这些都是实打实的固定成本。一家运营1000个点位的中型公司能不能养得起一个LLM推理集群?如果不能,就只能接入第三方API,又回到成本和延迟不可控的局面。
风险三:用户隐私红线
从"识别商品"到"识别消费者"只有一步之遥。当AI视觉货柜开始采集面部信息做个性化推荐时——不论是DOZZON的AI体质辨识还是其他厂商的人脸支付——数据合规问题就从"基本安全"变成了"高敏感"。端侧推理是当前的合规避风港(数据不出柜),但一旦需要云端大模型做更高精度的消费者画像,数据就必须上传。这条红线的位置和移动速度,可能是未来三年行业最大的不确定性。
2026年7月某天下午,深圳南山科技园那台AI视觉开门柜又出了一笔识别异常:一个用户同时取了一瓶东方树叶乌龙茶和一瓶东方树叶茉莉花茶,系统只扣了一瓶的钱。后台日志显示:两瓶饮料在关门瞬间几乎重叠,称重传感器检测到的总重量变化恰好等于一瓶半乌龙茶的重量(因为茉莉花茶的密度和乌龙茶一样),被校验逻辑误判为"取了一件"。这笔漏单金额不过5.5元。
但它提醒了一件事:99.1%不是终点,剩下那0.9%里,藏着的是物理世界无穷无尽的边缘情况。AI视觉货柜的真正挑战,从来不在实验室数据集里。