日期:2026-09-27
标签:#面试 #AI应用开发 #RAG #知识工程
难度:中等
来源:牛面题目详情
一句话答案
多模态RAG需要把文本、图片等内容编码为可比较的表示,再按查询模态召回证据并交给生成模型。
面试回答要点
- 离线处理图片与文本,建立向量索引并保留模态和来源元数据。
- 图文双向检索可采用共享语义空间的编码器;OCR与图像描述可补充可检索文本。
- 评估跨模态召回质量,并在生成阶段保留原图或图像片段作为证据。
自测
- 不看笔记,用 60 秒回答:RAG系统如何支持多模态检索?图文检索如何实现?
- 结合自己的项目,补充一个具体场景、指标或取舍。
Maintained by · YihuiEdit on GitHub