本文提出PixelRAG,一种以网页原生视觉形式(截图)进行检索和阅读的新方法,无需文本抽象。它利用视觉嵌入模型(如Qwen3-VL-Embedding)在包含3000万张截图的数据库中高效检索,并将截图直接输入视觉语言模型(VLM)进行生成。实验表明,PixelRAG在文本密集型任务(如NQ、SimpleQA)、多模态开放域问答(MMSearch)、噪声新闻摘要(LiveVQA)以及智能体基准(MoNaCo)上均优于无检索和基于文本的RAG基线,准确率最高提升18.1%。此外,像素表示支持图像压缩,可在保证精度的同时将token成本降低至1/3,挑战了网络检索中文本表示的必要性。
核心观点
- PixelRAG使用网页截图而非文本进行检索增强生成,消除文本抽象依赖。
- 构建了包含3000万张截图的数据库,基于Qwen3-VL-Embedding模型微调实现高效视觉检索。
- 截图直接作为像素输入送入VLM,无需中间文本转换。
- 在NQ、SimpleQA等文本任务以及MMSearch、LiveVQA、MoNaCo等多模态和智能体基准上均显著优于文本基线。
- 通过图像压缩实现最多3倍的token成本降低,同时保持准确率。
技术要点
采用Qwen3-VL-Embedding作为基础视觉嵌入模型,在精心构建的对比训练数据上针对截图数据微调;检索到的截图以像素形式直接输入VLM(如视觉语言模型),无需转换为文本;支持不同分辨率的图像压缩以优化token效率。
应用场景
文本密集任务(NQ、SimpleQA)、多模态开放域问答(MMSearch)、噪声新闻语料(LiveVQA)、智能体基准(MoNaCo)