应用场景示意,设备型号与铭牌为视觉示例,不代表报道中的真实设备;非产品界面截图。
图注:应用场景示意;画面中的设备型号、序列号和铭牌参数均为视觉示例,不是新闻事实或产品测试数据。
Google DeepMind 10月6日发布EmbeddingGemma 2:7.4亿参数,采用Apache 2.0许可,目标是把文本、代码、图像、视频帧和音频映射到统一向量空间。Google Developers Blog给出了一个更贴近产品现场的数字:完整多模态模型在Pixel 11 Pro上约占567MB活跃内存;文本模块约191MB。这些是厂商披露的特定设备、特定配置结果,不能直接理解为任何手机都能同样流畅地跑。但它把一道长期卡在云端的工序推到设备上:在原始资料离开手机前,先判断该找哪段、该交给谁处理。
检索模型不负责写一篇漂亮回答。它把输入编码成向量,让相近内容在向量空间里靠近。应用可以用这个结果查找照片、找到相关文档段落、把指令送到合适的处理模块,再决定是否有必要调用大型生成模型。对企业而言,这比“手机也能跑AI”更具体:能否把搜索和路由放到本地,降低原始数据外传与等待时间,同时保持足够可靠的召回?这才是EmbeddingGemma 2值得试的地方。
先分清检索、生成与路由
假设现场工程师拍下一张设备铭牌,希望查维修手册。纯生成式路径是把照片和问题一并发给大模型,让它读、猜、写答案;一旦型号识别错,它可以把错误写得很完整。检索式路径不同:应用先把图片编码为向量,在预先建好的手册索引中找相近条目;再用型号、版本和权限等确定性条件过滤,最后把少量候选页交给人工或生成模型解读。检索未找到可靠证据时,就明确告诉用户没有命中。这条路径并不保证正确,但每一步更容易计数和复核。
统一向量空间的用途,是让不同模态有机会以同一个相似度框架比较。例如文字“阀门渗漏”可以作为查询,去找相关图片或视频帧;一段语音问题可以先与某个知识库描述对齐。这里的“统一”只提供候选匹配信号。视频事件的时间关系仍要看帧序列;音频逐字稿、图片OCR和结构化设备编号也有各自用途。业务系统仍需按时间、来源和具体身份做二次判断。
路由也一样。Google称该模型可以将输入与标签或描述直接匹配,支持毫秒级零样本意图路由,而不必为每个标签单独训练分类器。试点时可以把“查设备手册”“创建维修工单”“找同类故障照片”写成稳定的标签描述,让模型给出匹配分数,再设置一个拒绝或转人工阈值。不过,相似度分数不是企业政策本身;标签语义重叠、方言、噪声语音和越权请求都可能造成误路由。涉及执行动作的工单创建,应另有身份校验和确认步骤,不应由最高相似度自动放行。
567MB能说明什么,不能说明什么
活跃内存数字说明端侧可行性正在改善,却不等于完整产品只需要这么多内存。真实应用还要装索引、缓存、界面、其他系统服务;相机或音频预处理也要资源。索引有多大、检索速度如何随资料量变化、启动时延、耗电和持续运行的热负载,都不在“模型活跃RAM”一个指标里。文本模块约191MB与完整多模态模型约567MB是两种不同配置,不应拿前者来推销后者的全部能力。
更重要的是测试设备。Pixel 11 Pro上的披露表现,是一个设备上的结果。企业现场的旧手机、平板或边缘网关,内存、算力和散热可能完全不同。试用时至少找目标设备中的低配机,连续运行而非只跑首个请求:测冷启动与热启动、后台切换后是否重新加载、连续拍照检索的延迟和电池损耗。若离线状态下慢得不能用,所谓端侧收益就只是发布会数字。
把账算完整,还得看索引放哪儿。仅在设备上算查询向量,却把完整原始资料上传到云端建库,并不能宣称“数据始终留在本地”。反过来,把所有文档索引塞进一台手机,也可能难以控制版本、权限或存储。可以按敏感级别拆分:个人照片与离线资料索引留在设备,公开知识库可由服务端维护;需要跨团队共享的文档则由企业统一管控。每一层都说明原始数据、向量和查询日志是否离开设备。向量是从数据提取的表示,不该被当作天然匿名的垃圾数据随意传输。
给端侧RAG搭一个真正能检查的流程
RAG,即检索增强生成。把EmbeddingGemma 2放入其中,第一步不是接聊天框,而是清理资料库:文档按页码、标题和版本切段,图片与视频帧保留时间戳、设备编号和来源,过期资料标注失效。向量模型只看见你给它的输入,错误版本进了索引,检索效果再好也会把错误材料找出来。索引更新时要做版本切换,避免一半新手册、一半旧手册混在同一批结果中。
第二步是把查询与资料编码后检索,留下可追踪的候选。相似度的前几名只是候选,最好再用关键词、精确编号、文档权限和业务状态筛一遍。譬如两台设备图片很像,序列号却不同;这个时候用序列号过滤,比继续调嵌入模型更可靠。第三步才把候选片段送给生成模型组织答案,并要求引用来源。若端侧算力或业务需要不能支持完整生成,就只显示命中的手册页;并非每个检索场景都得把大模型请来写总结。
这个流程可用一个小型离线测试集验收。取用户真实会问的短语、含错字的口语、图片与截取不完整的视频帧,分别准备“应该检索到哪段”“根本不该命中”“只能在授权后显示”三类标注。记录Top-k召回率,还要看每种模态的失败分布;中文问法、英文代码注释和嘈杂音频不能只汇成一个平均分。索引一更新,就用相同问题回归测试,观察原来排第一的准确答案是否被新资料挤掉。
图为主题示意,不表示已有实测结果。
企业常喜欢追问“向量维度多少、索引算法选哪种”。这些确实影响资源,但不应先于答案可追溯。测试时保留模型版本、分段规则、检索参数与文档版本;否则两周后业务同事说“上次还能搜到”,技术团队连错误从哪一层发生都找不出。评测结果最好分开统计检索未召回、召回但排序靠后、资料本身错误、生成时误引四类问题。只调一个模型解决不了所有问题。
隐私收益有条件,别把“本地”写成护身符
端侧计算能让部分查询不必先把原始图像、语音和文本送往远端;响应也可能减少网络往返。这个方向对个人照片搜索、离线维修手册和敏感内部材料尤其有吸引力。但“模型在本地”与“应用保护隐私”不是同义词。应用仍可能上传搜索词、向量、点击记录或生成阶段所用的片段;手机丢失后,本地索引与缓存也可能被访问。要把数据流图画出来,再谈收益。
合规部门需要的是可检查的边界:哪些资料可索引,向量与原文保存多久,谁能调用检索接口,卸载应用时是否清除索引,设备遗失如何撤销访问。对于多人共用的工业平板,还得避免甲班组搜索结果带出乙班组的受限文档。权限过滤最好在返回候选以前生效,不能只在生成答案的提示词里写“请不要泄露”。这里的机制是一般应用设计建议,并非Google替企业提供了这些治理功能。
Apache 2.0许可降低了模型集成的法务门槛,但企业仍要核对模型包、依赖、数据集和所用分发渠道的实际条件。开放模型也不会自己解决设备更新问题:如果每台终端运行的模型版本不同,向量索引可能需要重建或分版本维护。更新策略与网络不稳定时的回退方案,在试点初期就要设计,而不是等终端铺开后补救。
什么时候该上,什么时候别急
试点可以从本地照片、离线资料检索入手:数据本就在设备上,省掉云端往返容易算出时间差。维修手册、员工操作指南也适合,但要先把版本管理和可引用片段做好。若用它给请求分类,执行动作之前仍需规则或人工确认。这些流程至少有一个共同条件:正确答案与失败案例都能留样复核。
不适合直接上生产的情况也很具体。资料经常失效却没有索引更新机制;任务主要靠精确编号匹配,传统数据库查询更准;权限模型混乱;团队只准备测一个演示问题就宣称“可用”。若主要工作是生成长文或复杂推理,EmbeddingGemma 2本身也不是替代大型生成模型的答案。它应占据检索与路由这一层,不能被当作万能端侧助手卖给业务部门。
试点若只做两周,可以把验收设计得足够窄:先选一组有确切答案的资料,不超过一个业务线,保留现有关键词检索作为基线。第一周建立索引与人工标注,第二周让同一批使用者并排试两套搜索。除了命中率,记录他们点开结果后还要翻几页、需要多久找到证据、是否因错误候选耽误工作。相比离线相似度分数,“用户用它少走了几步”更接近真实收益;但不要只挑模型擅长的跨模态问题,应把能由精确搜索秒答的编号问题也放进去。
这里有一个看似琐碎的工程细节:图片和视频帧要附着在可读的业务对象上。向量搜索找到一张相似的油污照片,若没有采集时间、设备型号和工单编号,维修人员仍不知道它能否作为这次故障的参照。音频也要决定保留原声、转写稿还是两者皆有;噪声环境的录音若听不清,检索模型无法凭一个相似度分数补齐丢失的事实。多模态的收益来自把原先隔开的线索连起来,而不是替资料管理补课。
最后要测一次最不体面的情况:设备没有网,索引刚好更新失败,用户提出一条不在库里的请求。应用此时是展示旧版本并注明日期、退回传统目录搜索,还是猜一个相近答案?这些选择应由产品和业务负责人事先确定,并写入可回归的测试。端侧方案多了一份对网络的独立性,也多了一套版本同步和故障恢复责任。只有在断网与失配时仍能诚实地告诉使用者自己不知道,它才适合进入日常工作。
Google此次发布最扎实的产品问题是:能否把寻找证据的第一步放到设备附近,再把少量真正需要推理的内容交给更大的模型。企业值得为此做试验,不值得凭567MB和“多模态”两个标签马上采购一套新系统。先拿旧设备和难检索的真实资料跑一次离线测试;如果召回、权限、延迟和耗电都过线,端侧部署才有下一步。否则,留在现有检索系统里修索引,可能比换模型更有效。
对应日报与资料来源
本文对应《2026年10月7日三篇日报》“AI技术每日分析”第二节“Google发布EmbeddingGemma 2:多模态检索开始下沉到手机和边缘设备”。参数、模态、许可和内存数字来自该节所列Google材料;索引、数据流和验收设计为本文提出的落地方法,不是该模型已验证的企业成效。
- Google DeepMind,《EmbeddingGemma 2: an open, lightweight multimodal embedding model》,2026-10-06:https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
- Google Developers Blog,《Bring multimodal semantic search to the edge with EmbeddingGemma 2》,2026-10-06:https://developers.googleblog.com/en/google-ai-edge-with-embeddinggemma-2/