以下部分引用 AI 总结,现阶段 AI 仍然有幻觉。请以内容的原文为准。
数据新鲜度群聊 07-14 ✓卖方 07-14 ✓Wrap 断档15天 ✕News 07-15 ✓X 断档12天 ✕页面生成 07-15
WildClawBench
5 atoms · 跨 2 天 · 首见 2026-04-21 · 最近 2026-05-17
三色: 🟦 fact 4 · 🟥 take 1 · stance ▲0/▼0/◆0
来源: X 5
时态: fresh:5
标签: 好数字:3 · 好观点:1 · 好思考:1 · 好信源:1
叙事 (narrative) (1)
- 2026-05-17 · 新标准
WildClawBench is the new standard for hard agent evaluation
tags: 好观点 · → daily
事实 (fact) (4)
- 2026-05-17 · 19模型测试结果
19 frontier models tested — Claude Opus 4.7 leads at 62.2%, most stay below 60%.
tags: 好数字·好信源 · → daily
value: qty=62.2%
- 2026-05-17 · 任务数量
60 tasks averaging 8 minutes and 20+ tool calls each.
tags: 好数字 · → daily
value: qty=60
- 2026-05-17 · 运行环境
No mocks, real tools, real Docker containers.
tags: 好思考 · → daily
- 2026-04-21 · 测试结果
Claude Opus scored just 51.6%
tags: 好数字 · → daily
value: qty=51.6% · date=2026-04-21
时间轴 (近 20)
- 2026-05-17 ·
narrative · 新标准 · → daily
- 2026-05-17 ·
fact · 任务数量 · → daily
- 2026-05-17 ·
fact · 运行环境 · → daily
- 2026-05-17 ·
fact · 19模型测试结果 · → daily
- 2026-04-21 ·
fact · 测试结果 · → daily
← 实体目录 · 系统日志