系统日志
以下部分引用 AI 总结,现阶段 AI 仍然有幻觉。请以内容的原文为准。
数据新鲜度群聊 07-14 ✓卖方 07-14 ✓Wrap 断档15天 ✕News 07-15 ✓X 断档12天 ✕页面生成 07-15

GLM-5.1

35 atoms · 跨 23 天 · 首见 2026-04-17 · 最近 2026-06-22

三色: 🟦 fact 28 · 🟥 take 7 · stance ▲7/▼3/◆7

叙事状态: 🍂 fading (退潮) · 💤 沉寂 · 策展近14d 0 atom

状态只算低频策展源 (群/卖方); X firehose 仅作背景音量

来源: X 35

时态: fresh:34 · aging:1

标签: 好数字:24 · 好信源:7 · 好观点:7

🟨 AI 综合 · junior analyst 概览

展开 AI 综合 (灰色 · 非市场结论 · 点击数字溯源到原 atom)
model: deepseek-chat · 2026-07-12 · 默认折叠
GLM-5.1 在 SWE-Bench Pro 和 Coding Agent Index 上均位列开源第一 [id=d0447e8b72c0642d,cec80b1542200bd4],编码能力非常强 [id=11810fe2779eac84]。ALE-Bench 表现优于 Grok-4.3 [id=baeb3eca2b5b8c9a],整体水平已与 GPT-5.2-Codex-xhigh 相当 [id=adc3330aefaeeea3]。不过 FutureSim 显示开源与闭源模型差距巨大 [id=b73d6877f2cd9715],且其上下文窗口较短是一大短板 [id=21cd623830f686bf]。每次任务成本 $2.26 但 token 使用量高达 4.8M [id=1330148a6199d854,5559e1f1d936f8eb],CritPT 评分仅 20.9 [id=1966634d8e8bca36]。CyberGym 得分 68.7%,与 Claude Opus 4.6 相当 [id=7ad8bcaa3c51e66b],并已通过 Harvey 法律基准进行后训练 [id=57836df21cc0c49b]。

🧭 拥挤度 (一人一票): ▲ 3 位作者 (KOL3) vs ▼ 2 位作者 (KOL2)

🟦 客观事实 (facts) (28)

🟥 多头 takes (bullish) (4)

🟥 空头 takes (bearish) (2)

🟥 中性 takes (neutral) (1)

⏱ 时间轴 (近 20)


实体目录 · 系统日志