HiDeepSeekDev
空闲特惠
Agent 评测AI AgentDeepSeekThinkingBox基准测试MCP

微软与 Hugging Face 发布 ThinkingBox:Agent 评测转向最终状态与重复成功率

微软与 Hugging Face 10 月 3 日公开 ThinkingBox 评测环境,使用 507 个有状态业务任务和重复运行,检查 Agent 是否真正改对记录。作者报告 DeepSeek-V4-Pro 的单次通过率为 43.26%;该分数仅适用于论文的模型配置和任务集。

快速结论

ThinkingBox 不只看 Agent 最后的回答或工具调用是否成功,而是检查数据库最终状态、漏做和多做的操作,并让同一任务运行 20 次。项目方报告的一次性通过率与持续可靠性差距明显;团队可借鉴“核对实际结果、重复试验”的评测方法。

  • 微软与 Hugging Face 的联合文章发表于 2026 年 10 月 3 日。
  • ThinkingBox-Bench 包含 507 个有状态业务任务,覆盖零售、保险、旅行、银行和企业 IT。
  • 作者在共同样本分析中记录 121,680 次有效运行,其中 79,853 次未通过可执行检查;失败次数并不等同于全部模型的线上故障率。
  • 联合文章报告 DeepSeek-V4-Pro 在该任务集的总体 pass@1 为 43.26%,需按评测模型版本与设置解读。

本次更新:新增 ThinkingBox 评测解读,核对论文、联合文章及 DeepSeek-V4-Pro 在指定任务集中的成绩。

**核验时间:2026 年 10 月 5 日;联合文章发布于 10 月 3 日。**微软与 Hugging Face 公开 ThinkingBox 评测环境,讨论工具型 Agent 经常出现的一个问题:回复看似完成任务,但后台记录没有达到要求。项目提供隔离的 MCP 工具会话、业务初始状态和可执行检查,让评测以任务结束时的实际状态为依据。

评测怎样进行

ThinkingBox-Bench 收录 507 个有状态业务任务,涉及零售、汽车保险、旅行、银行和企业 IT。每个任务定义目标、可用工具、业务政策及需要达到的后台状态。研究团队对每个任务重复运行 20 次,分别观察单次通过、至少成功一次和 20 次全部成功的情况。

例如客服 Agent 可以正确查询订单、调用工具,却错误地把仍待物流处理的工单标记为“已解决”。只核对最终文字或调用格式容易漏掉这种错误;检查工单字段和多余副作用才能发现。

报告中的数字如何读

微软与 Hugging Face 在共同样本分析中记录 121,680 次有效运行,其中 79,853 次未通过可执行检查。研究者指出,一些失败运行仍正常结束并执行了状态修改。各类失败原因可能重叠,不能把其中比例相加,也不能将整个基准中的失败率推算为任意产品的线上故障率。

联合文章的任务加权结果显示,DeepSeek-V4-Pro 在该版本基准的单次通过率为 43.26%。这说明其在该任务集和评测配置下的表现;结果受模型版本、提示、工具实现与判分规则影响,不是 DeepSeek API 的服务等级或通用能力排名。

开发团队怎么用

  1. 为真实业务任务定义可检查的最终状态,同时列出绝不应产生的副作用。
  2. 让每次运行从相同的隔离数据开始;重复运行,报告平均通过率和连续成功率。
  3. 将工具报错、前置条件失败、漏执行与错误字段写入分开的诊断记录。
  4. 对支付、删除、发信等高影响操作保留审批和回滚,并在提交前再次核对实际状态。

运营判断: Agent 的“完成”提示不能代替结果验收。对已连接工单、订单或内部系统的产品,先建立状态校验和重复运行样本,再讨论自动化比例。

参考资料

本文依据以下资料整理,版本与接口信息请以来源页面的现行说明为准。

  1. 01微软与 Hugging Face 联合文章:ThinkingBox(10 月 3 日)huggingface.co
  2. 02arXiv:One Success Isn’t Reliability: Thinkingboxarxiv.org
  3. 03微软 ThinkingBox 代码与评测数据github.com
阅读至此返回学习中心