本文提出PixelRAG,一种以网页原生视觉形式(截图)进行检索和阅读的新方法,无需文本抽象。它利用视觉嵌入模型(如Qwen3-VL-Embedding)在包含3000万张截图的数据库中高效检索,并将截图直接输入视觉语言模型(VLM)进行生成。实验表明,PixelRAG在文本密集型任务(如NQ、SimpleQA)、多模态开放域问答(MMSearch)、噪声新闻摘要(LiveVQA)以及智能体基准(MoNaCo)上均优于无检索和基于文本的RAG基线,准确率最高提升18.1%。此外,像素表示支持图像压缩,可在保证精度的同时将token成本降低至1/3,挑战了网络检索中文本表示的必要性。

核心观点

技术要点

采用Qwen3-VL-Embedding作为基础视觉嵌入模型,在精心构建的对比训练数据上针对截图数据微调;检索到的截图以像素形式直接输入VLM(如视觉语言模型),无需转换为文本;支持不同分辨率的图像压缩以优化token效率。

应用场景

文本密集任务(NQ、SimpleQA)、多模态开放域问答(MMSearch)、噪声新闻语料(LiveVQA)、智能体基准(MoNaCo)