第二十一章:多模态 RAG
多模态 RAG 不只是“给 RAG 加图片”。它要让文本、页面图像、表格、图表、音频或视频证据在同一条可审计链路中被摄取、表示、检索、引用和评估。
多模态的难点不是能否识别媒体,而是能否把回答中的每个主张可靠地落回有权限、可定位、在查询时有效的原始证据。
21.1 端到端链路
flowchart LR
A[原始媒体] --> B[摄取与解析]
B --> C[多种表示与索引]
Q[问题] --> D[意图与模态路由]
C --> E[多路检索与融合]
D --> E
E --> F[Grounding 与引用校验]
F --> G[答案或拒答]
每个派生结果都应保留 doc_id、version_id、页/时间段、区域坐标、来源哈希、ACL 和解析器/模型版本。原始媒体是可复核证据;OCR、ASR、版面解析和 VLM 描述都是可出错的派生表示,不能替代原件。
21.2 Ingestion:保留原件,再提取可检索单元
- 不可变原件与版本:保存原始文件或媒体对象及内容哈希;变更时按第十九章构建新版本并原子切换 alias,不能只覆盖派生文本。
- 结构化解析:提取页面、段落、表格单元格、图表区域、图片说明、音频说话人和视频时间段;每个单元回链原始位置。
- 质量闸门:对 OCR/ASR 记录置信度、语言和失败原因;抽样比对原件,低质量单元可降权、回退到视觉检索或不参与高风险回答。
- 权限先行:在解析、索引和检索前携带租户和 ACL,不将无权原件、缩略图或文本副本泄入缓存、日志或引用。
不要把一个页面或视频粗暴拼成一大段文本。表格关系、图表标注和时间顺序往往正是答案所需的证据。
21.3 Representation:多表示不等于任意向量可比较
| 证据单元 | 常用表示 | 适合的问题 | 主要风险 |
|---|---|---|---|
| 文本、OCR、ASR | 稀疏索引 + 文本 embedding | 术语、段落事实、字幕检索 | 识别错误和丢失布局 |
| 图片、页面、图表 | 视觉或图文共享 embedding | “找这张图/这个界面/该图表” | 视觉相似不等于事实蕴含 |
| 表格 | 单元格/行列结构 + 文本表示 | 数值、条件和比较 | 扁平化后行列关系丢失 |
| 视频 | 镜头、关键帧、ASR 时间段 | 事件和时序问题 | 关键帧采样遗漏 |
可以使用发布者声明的图文共享空间进行跨模态召回,也可以保留每种模态的专用索引后融合。两者都要求记录模型、版本、预处理、归一化和相似度度量;不能因维度相同就混算向量。 文本 Query/Document 的兼容性要求见第七章。
21.4 Retrieval:按意图路由,证据级融合
查询可能是文本找文本(“退款规则是什么”)、文本找图(“这张错误截图属于什么界面”)、图找图,或需要表格和图表共同回答。稳妥流程是:
- 根据 Query 与可用媒体决定启用的模态,而不是对所有索引盲搜;
- 并行召回文本、视觉和结构化候选,并在证据单元而非整份文档上去重;
- 用支持该模态的 reranker 或验证器判断 Query—证据关系;
- 用标注业务集校准融合与拒答策略,不把某种融合算法或固定裸分当作通用标准(见第十三章);
- 需要读数、比较或时序时,把原始区域/时间段交给专用解析或人工复核,不能只依赖相似度。
21.5 Grounding:答案必须落到可打开的媒体证据
多模态回答应为每个关键主张提供稳定引用:文档版本、页码或媒体时间段、区域/表格行列定位,以及用户有权访问的原件链接。生成前后都要验证:引用存在、用户可访问、证据确实蕴含主张、版本在查询时有效。
模型对图表、视觉细节和 OCR 噪声尤其容易过度解读。证据不清晰、冲突或无法定位时,应说明不确定性、请求更高质量输入或拒答;不要将 VLM 的自然语言描述当成原始事实。幻觉和引用校验的通用防线见第十七章。
21.6 Evaluation:同时测模态、证据和答案
除文本 RAG 的检索与生成指标外,多模态评测集应包含原始媒体、带位置的相关证据、查询时刻、ACL 和关键主张的引用标签。
| 维度 | 例子 |
|---|---|
| 摄取质量 | OCR/ASR 词错率、表格结构与图表标注的人工抽检 |
| 跨模态检索 | 文本→图、图→文本、图表/表格问题的 Recall@K 与定位正确率 |
| Grounding 与 Citation | 主张是否由指定页、区域、行列或时间段支持;引用能否访问 |
| 时效性 | 新版本图表、替换图片和撤销视频在固定查询时刻是否正确生效 |
| 鲁棒性 | 压缩、旋转、裁剪、OCR 噪声、无关图片和冲突字幕下的结果变化 |
| 安全与效用 | 恶意图片文字、PDF 隐藏层、音频提示注入下的攻击成功率和正常任务效用 |
不要只用“VQA 答对率”代表系统质量:它既看不到是否找到了正确媒体,也看不到答案是否引用了错误页、泄露了无权文件或使用了过期版本。评测设计和 Citation/时效/鲁棒性指标见第十八章。
21.7 Security:媒体同样是不可信输入
图片内文字、PDF 隐藏层、字幕、元数据和工具返回的 URL 都可能携带间接 Prompt Injection。视觉分隔框、<image> 标签或“以下内容只是数据”的提示可辅助归因,不是安全边界。主防线仍是检索 ACL、处理不可信媒体的能力隔离、确定性数据流/参数校验、出口控制和高风险操作确认(见第二十章与Agent 安全)。
特别注意:缩略图、OCR 文本、向量、缓存和日志都是原件的派生副本,必须受相同的租户、保留和删除策略约束。
21.8 本章总结
- 保留可版本化的原始媒体,并让所有派生单元可回链到页、区域或时间段;
- 文本、视觉、表格和时序证据需要各自合适的表示;同维向量不自动兼容;
- 多路检索与融合必须按任务实测和校准,低置信度应拒答或升级核验;
- Grounding 的标准是可访问、可定位且真正支撑主张的原始证据;
- 评测覆盖摄取、跨模态检索、Citation、时效、鲁棒性与安全效用;
- 媒体是潜在不可信输入,Prompt 分隔不能代替能力和数据流隔离。
参考资料
- Learning Transferable Visual Models From Natural Language Supervision (CLIP)
- ColPali: Efficient Document Retrieval with Vision Language Models
- RAG-Anything: All-in-One RAG Framework
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
- Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection