MLPerf 发布端到端 RAG 推理基准

MLCommons MLPerf Inference 工作组推出首个端到端检索增强生成(RAG)推理基准。通过在查询时从检索文档而非仅模型权重中生成答案,RAG 显著降低幻觉,同时利用最新私有知识,已成为语言模型最常见的部署方式之一。

RAG 生产系统通常由多个模型组成,形成检索文档并推理生成答案的完整管道。该基准完整测量这一流程,包含两个工作负载。

端到端 RAG 的意义

RAG 因能从查询时检索的文档中获取答案而日益流行。它减少幻觉、保持答案时效性,并让通用模型利用训练时未见过的专有知识。

由于 RAG 是多组件系统,其性能源于各组件的协同而非单一模型。单模型 LLM 基准无法捕捉管道级行为,也无法暴露多模型联合优化的机会。

该基准还为智能体 AI 基准铺路,其多模型服务挑战正是未来基准的起点。

优化空间包括:

  • 模型放置:将不同规模模型映射到不同加速器
  • 共驻:通过内存分区共享设备
  • 多阶段调度:跨异构加速器实现宏微批处理
  • 前缀缓存:复用多跳共享前缀以降低计算

数据集与任务

基准基于 FRAMES 多跳查询数据集,包含 824 个查询、2515 篇维基百科文章和约 107000 个 768 字符段落。

示例多跳查询需要跨三篇文章链式推理才能得出答案。

图1

图 1:多跳 E2E RAG 示例

摄取与问答管道

基准包含两个独立管道:摄取管道(e2e-rag-db)一次性构建向量数据库,问答管道(e2e-rag-qna)执行端到端评分。

图2

图 2:E2E RAG 摄取与问答管道

摄取流程包括解析、切分、嵌入与 FAISS HNSW 索引。问答流程则通过查询重写器、嵌入器、检索器、重排序器、文档评分器与充分性检查器迭代完成多跳推理。

本文来自 MLC 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!