RAG 已死?向量检索之后的架构演进
长上下文与知识编辑技术正在挤压传统 RAG 的空间。共识判断是:RAG 不会死,而是退化为“检索层”,并入以 Agent 为中心的全新架构。
随着百万 token 上下文与知识编辑技术的普及,“RAG 已死”的讨论再次出现:既然模型能直接读完全部资料,为什么还要检索?
工程实践给出的答案是分层的:长上下文解决“读得下”,但读得下不等于读得准——大海捞针测试显示超长上下文的中段信息召回仍不稳定。检索依然是精度与成本的双重最优解。
真正的变化在架构层面:RAG 从“独立系统”退化为 Agent 架构里的一个检索工具,由模型自己决定何时调用、检索什么。结论:RAG 作为术语会淡化,作为能力会无处不在。
本文为编辑摘要与评述,原始报道见 知乎。 版权归原出处所有。
继续阅读
推理模型调用量首超对话模型,AI 使用范式正在切换
推理(思考型)模型的 API 调用量首次超过普通对话模型,意味着开发者正在从“让 AI 写”转向“让 AI 想清楚再写”。价格下降与工具调用需求是两大推手。
国产大模型降价潮:推理价格再降 50%
多家国产大模型厂商同步下调 API 推理价格,百万 tokens 最低进入“分时代”。降价被解读为对海外模型的正面价格攻势,也进一步压低了 AI 应用的创业门槛。
开源模型追平闭源:综合差距缩至 3% 以内
最新评测显示头部开源模型与闭源旗舰的综合能力差距已缩至 3% 以内,而推理成本只有后者的十分之一。开源不再是“平替”,而是多数场景的更优解。