← AI 资讯

实测打脸:小模型 Agent 成功率反超部分旗舰

来源:Hacker News ↗ Agent评测

一份覆盖 12 个模型的实测显示:指令明确的多步工具调用任务里,小模型的成功率反超部分旗舰模型。上下文管理能力而非参数量,成为 Agent 的分水岭。

一份覆盖 12 个主流模型的多步工具调用实测给出了反直觉结果:在指令明确的 Agent 任务上,几个轻量模型的成功率反超旗舰模型。

研究者归因于上下文管理:旗舰模型倾向于“多想”,在长任务中累积的自我纠正反而污染上下文;小模型更倾向严格遵循指令,步步为营。

实践建议:Agent 系统的默认路由可以按任务复杂度分级——明确流程的任务用小模型(更快更便宜更稳),开放规划类任务再升级到旗舰,成本可下降 60% 以上。

本文为编辑摘要与评述,原始报道见 Hacker News。 版权归原出处所有。

继续阅读

国产大模型降价潮:推理价格再降 50%

多家国产大模型厂商同步下调 API 推理价格,百万 tokens 最低进入“分时代”。降价被解读为对海外模型的正面价格攻势,也进一步压低了 AI 应用的创业门槛。

微博 AI #行业#价格战

开源模型追平闭源:综合差距缩至 3% 以内

最新评测显示头部开源模型与闭源旗舰的综合能力差距已缩至 3% 以内,而推理成本只有后者的十分之一。开源不再是“平替”,而是多数场景的更优解。

量子位 #开源#评测