AINEWS 搜索
← 返回事件实质进展 10月07日 05:55
STORY IN FOCUS

Parsewave 发布 AutomationBench Verified,修复 206 个任务判分错误

Parsewave 审查了 Zapier 的 AutomationBench 全部 600 个公开任务,经人工确认并修复 206 处判分错误。用修复前后的判分器重评 1,235 次 Kimi K3 运行时,344 次(27.9%)得到不同结果,显示基准测试的评分方式会影响模型成绩。

1 次进展3 篇报道1 个来源

事件进展

同一次发生的报道合为一个节点,后续进展单独记录。

Parsewave 发布 AutomationBench Verified,修复 206 个任务判分错误

Parsewave 审查了 Zapier 的 AutomationBench 全部 600 个公开任务,经人工确认并修复 206 处判分错误。用修复前后的判分器重评 1,235 次 Kimi K3 运行时,344 次(27.9%)得到不同结果,显示基准测试的评分方式会影响模型成绩。

查看来源报道 · 1 个来源 · 3 篇报道
全部报道 · 3

按来源发布时间排列,保留各报道的收藏与反馈。

Rohan Paul (@rohanpaul_ai) AI 辅助摘要 同事件
编辑优先级 54/100
Parsewave 发布 AutomationBench Verified,修复自动化基准的 206 个评分错误

Parsewave 审查了 Zapier AutomationBench 的全部 600 道公开任务,发现并修复 206 个评分器错误。用修复前后的评分器重新评判 1,235 次 Kimi K3 运行时,344 次(27.9%)得到不同成绩,显示评分规则会影响对智能体表现的判断。

同一事件,精选展示《Parsewave 发布 AutomationBench Verified,修复 206 个任务判分错误》
Rohan Paul (@rohanpaul_ai) AI 辅助摘要 精选
编辑优先级 60/100
Parsewave 发布 AutomationBench Verified,修复 206 个任务判分错误

Parsewave 审查了 Zapier 的 AutomationBench 全部 600 个公开任务,经人工确认并修复 206 处判分错误。用修复前后的判分器重评 1,235 次 Kimi K3 运行时,344 次(27.9%)得到不同结果,显示基准测试的评分方式会影响模型成绩。


推荐理由:对关注模型评测的读者,1,235 次运行中有 27.9% 因判分器修复而改变结果,是解读该基准成绩时需要留意的具体影响。
Rohan Paul (@rohanpaul_ai) AI 辅助摘要 同事件
编辑优先级 47/100
AutomationBench Verified 发布,修复 206 个任务评分程序错误

项目方称,他们检查了 Zapier 的 AutomationBench 全部 600 个公开任务的评分程序,并修复人工复核确认的 206 个错误。用修复前后的程序重新评判 1,235 次 Kimi K3 运行后,344 次(27.9%)的评分发生变化。

同一事件,精选展示《Parsewave 发布 AutomationBench Verified,修复 206 个任务判分错误》