如果你问一个 AI:“这张货架照片里有什么?”
多模态大模型会像一位全科医生,扫一眼整张图,告诉你“这是一排饮料,左边是可乐,中间是茶饮”。它看得懂场景,会聊天,有上下文。
专用小模型则像一位专科医生,精准地圈出每一个商品框,告诉你“第 3 排第 2 个是 500mL 可乐,第 4 排第 5 个是 1L 可乐”。它速度快、精度高,但不会和你聊天。
那么问题来了:零售场景的货架识别,到底该用谁?
朗镜科技的答案是:两个都要。正是基于这一判断,朗镜科技构建了 ShelfMind 零售领域模型,让多模态大模型、专用小模型各司其职,将大模型的“懂”和“兜”与小模型的“快”和“准”完美结合,为零售场景下的货架识别提供了 AI 最优解,帮助品牌对零售渠道实施更高质量、更高效率的门店稽查、货架陈列检核。
能力对比:各有所长,各有所短
多模态大模型(VLM)—— 看得懂场景的“全科医生”。多模态大模型能“看”图并用自然语言“说”出来。它擅长整体理解 —— 读懂场景、理解文档、描述单张图的内容。指代识别(“左边那个”“第二层”)、关系判断(“价签和商品对应吗”)、VQA 推理、多步判断、报告生成,都是它的强项。
但多模态大模型不擅长:
· 闭集 SKU 识别:慢、贵,不如专用分类模型
· 规模化新品识别:单图能描述,批量无法稳定出 SKU ID
· 检测 / 分割 / 计数:精度、速度都不如专用小模型
· 检索匹配:不如 Embedding+ 向量检索
· OOD 告警:商品库太大,做不了可靠的“库里有没有”判断
多模态大模型能认出“这是什么牌子”,但认不准“这是哪一款、多大规格、什么包装”。它也不会用货架上的空间和价格信息来辅助判断。同一系列、同一口味的不同规格商品摆在一起时,大模型往往分不清 500mL 和 1L 的差别。
专用小模型 —— 精度与速度的“专科医生”。专用小模型在特定任务上优势明显。
· 闭集 SKU 识别,它比大模型更快、更便宜、效果更好。
· 检测、分割、计数任务,精度和速度优于大模型。
· 在价签检测和 SKU 识别这两个零售核心环节,框越多相对大模型越划算。
但专用小模型的不足之处在于:不具备场景理解和语言推理能力,无法独立完成复杂任务。
核心结论:复杂任务需配合大模型和其他算法搭建流水线,小模型只是其中一环。
朗镜科技 ShelfMind:让两者各司其职
既然大模型和小模型各有所长,那零售场景的最优解是什么?
朗镜科技 ShelfMind 零售领域模型的答案是:两者结合。采用“小模型快速分类 + 多模态大模型兜底难例”的级联架构,让每一类模型做自己最擅长的事。
小模型负责“快”和“准”—— 价签检测、SKU 识别这些高频、高精度要求的任务,交给专用小模型。
大模型负责“懂”和“兜”—— 复杂场景的理解、困难样本的兜底、语义推理和报告生成,交给多模态大模型。
这正是朗镜科技的核心思路:不靠单一模型解决所有问题股票配资官网开户,而是让合适的模型做合适的事。
元鼎证券_元鼎证券登录入口-欢迎快速登录,轻松使用各项服务提示:本文来自互联网,不代表本网站观点。