← AI 资讯

OpenAI 开源推理模型评估框架

来源:Hacker News ↗ 评测OpenAI

OpenAI 把内部用于评审推理模型的评估框架开源,支持自定义任务基准与过程奖励打分。评测标准化被视为 Agent 落地前的关键基建。

OpenAI 开源了其内部使用的推理模型评估框架,支持自定义任务基准、多轮工具调用评测与过程奖励(process reward)打分——不仅看最终答案,也评估推理步骤的质量。

这一动作的行业意义大于工具本身:Agent 应用的落地瓶颈之一就是“无法客观比较模型在具体任务上的表现”,标准化评测是采购决策的前提。

开发者可以据此为自己的业务场景构建私有基准,避免被公开榜单误导——榜单测的是模型的上限,业务评测测的才是你的下限。

本文为编辑摘要与评述,原始报道见 Hacker News。 版权归原出处所有。

继续阅读

国产大模型降价潮:推理价格再降 50%

多家国产大模型厂商同步下调 API 推理价格,百万 tokens 最低进入“分时代”。降价被解读为对海外模型的正面价格攻势,也进一步压低了 AI 应用的创业门槛。

微博 AI #行业#价格战

开源模型追平闭源:综合差距缩至 3% 以内

最新评测显示头部开源模型与闭源旗舰的综合能力差距已缩至 3% 以内,而推理成本只有后者的十分之一。开源不再是“平替”,而是多数场景的更优解。

量子位 #开源#评测