Skip to content
Google Research·· 2026-08-12FeaturedAI Score63

空书架还是丢了钥匙?研究称检索是大语言模型参数化真实性的瓶颈

Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

AI Summary

Google Research 介绍了知识 profiling 行为框架和 WikiProfile 基准,用以衡量大语言模型的编码与检索能力。

  • 研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事实已被编码,但模型仍无法直接检索其中 26% 至 34% 的事实。
  • 这说明事实性错误主要源于知识无法可靠调用的检索失败,而非知识未被编码的存储缺失。
Why Recommended

研究指出前沿大语言模型的知识编码已接近饱和,准确率瓶颈在于检索而非存储,为后续训练与推理优化提供了新方向。

Source: Google Research · research.google