500 张真实照片、Open Images 官方标注做 ground truth、CLIP 真跑、百炼 qwen3.6-35b-a3b 真判。 下面每一个数字都是跑出来的,包括不利于这个结论的那些。
上面演示的是「重排」,但小米方案的第一个大模型介入点在更上游——把搜索词送进 CLIP 之前, 先用端侧小模型拆成结构化槽位。这一步的价值不在多认几个字,而在修掉小模型 NLU 的结构性错误: 传统 Bert 会把「日本豆腐」里的「日本」抽成地点槽位,这类错误不是调参能解决的。 下面这个框真跑百炼云端的 qwen-plus(本 demo 全链路走云端,不依赖任何本地模型)。
按真实相册的形态构造:猫是少数。三档难度全部由官方标注客观切分,不含我的主观判断。
只统计与 ground truth 语义严格等价的搜索词。「橘猫」「家里的宠物」这类更窄或更宽的词只供体验、不计分。 用「有没有猫」去判「是不是橘猫」的对错,会得出完全错误的结论。
小米方案提出用 SigLIP2 做统一 ViT backbone,同时服务图文检索与标签分类。其材料给的结论是 「未微调 SigLIP2 即优于 OS2 达 15%」——但那个比较基线是已被淘汰两代的 OS2。 这里在本站同一套 500 张标注语料上独立复现:只比召回质量,不掺 rerank,看纯检索谁更强。
小米方案的第三个介入点在建库侧:先用小模型给照片打标签,再用 VLM 逐个复核、重估置信度。 它给的三个输出样例全都表现为「剔掉细粒度标签、留下泛化标签」—— 我据此判断它会削弱长尾检索能力,但那只是从三个样例做的推断。 这里在 400 张真实照片、1157 个标签上跑了一遍,把这条推断变成可量化的结论。
CLIP 的错误高度结构化,不是随机的:混进来的几乎全是「猫的形象」——画、雕塑、邮票、包装图案。 向量相似度分不出「真猫」和「猫的图案」,这不是靠换更大的 CLIP 能解决的。
rerank 只作用于 top-30,与库大小无关:库从 500 张涨到 50 万张, 这部分成本不变,变的是 CLIP 检索那一段(向量检索,毫秒级)。