您现在的位置是: > 快讯快讯
OpenAI开源BrowseComp,重塑Agent浏览器评测
zhoucl 2025-04-11 05:39:27 快讯 已有人查阅
导读今天凌晨2点,OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度,连OpenAI自己的GPT-4o、GPT-4.5准确率只有0.6%和0.9%几乎为0,即便使用带浏览器功能的GPT-4o也只有1.9%。但OpenAI最新发布的Agent模型Deep Research准确率高达51.5%,在自主搜索、信息整合、准确性校准方面非常优秀。(AIGC开放社区)
今天凌晨2点,OpenAI开源测试基准BrowseComp,用于评估智能体浏览器功能。该基准难度极高,GPT-4o与GPT-4.5准确率分别仅为0.6%和0.9%,即使结合浏览器功能的GPT-4o准确率也仅1.9%。而OpenAI最新Agent模型Deep Research准确率达51.5%,在搜索、整合与校准方面表现突出。
本文标签:
很赞哦! ()
上一篇:问链网:今天市场下跌不是什么大事