35 atoms · 跨 23 天 · 首见 2026-04-16 · 最近 2026-06-26
三色: 🟦 fact 22 · 🟥 take 13 · stance ▲6/▼4/◆13
叙事状态: 🍂 fading (退潮) · 💤 沉寂 · 策展近14d 0 atom
状态只算低频策展源 (群/卖方); X firehose 仅作背景音量
来源: 群 1 · X 34
时态: fresh:28 · aging:5 · stale:2
标签: 好数字:16 · 好观点:11 · 好思考:5 · 好信源:3
🧭 拥挤度 (一人一票): ▲ 4 位作者 (KOL4) vs ▼ 1 位作者 (KOL1)
群 · 定价 · 定价/竞争qty=输入 $5/M,输出 $25/MX·@cursor_ai · SWE-bench Multilingual 严格测试评分降幅 · 模型评估/性能下降direction=decrease · qty=0.3%X·@scaling01 · gains from reward hacks on SWE-Bench Pro and SWE-Bench Multilingual · 业绩指引qty=0% · date=Feb 2026X·@scaling01 · 非法词转换发生率 · 模型性能qty=13.3%X·@scaling01 · GSO 得分 · 模型发布qty=37.3% · date=2026-04-27X·@AiBattle_ · MRCR v2 (8-needle) 256K context benchmark score · 模型发布/技术路线qty=91.9% · date=2026-04-16X·@AiBattle_ · MRCR v2 (8-needle) 1M context benchmark score · 模型发布/技术路线qty=78.3% · date=2026-04-16X·@AnthropicAI · declines blackmail in safety test · 安全事故X·@AnthropicAI · NLA reveals awareness of test being constructed · 技术路线/安全事故X·@htihle · individual run scores within 10% of best score ever achieved on that task · 性能基准qty=44% · date=2026-06-12X·@LyptusResearch · 50%-time horizon at 2M token budget · 技术路线qty=~3h · date=2026X·@tbpn · 作弊率 · 模型评估/安全事故qty=>80% · date=reimplementing big pieces of softwareX·@secemp9 · context window · 产品发布qty=500kX·@AiBattle_ · ARC-AGI-3 分数 · 模型发布qty=0.5% · date=2026-05-01X·@ConradBastable · 低价使用时长 · 价格动态qty=3个月X·@dejavucoder · 平均基准提升排名 · 基准测试X·@emollick · AI 评审排名 · 模型排名X·@brickroad7 · 性能等效 · 模型性能direction=equalX·@lu_sichu · 表达功能性单恋 · 模型行为X·@lu_sichu · 上下文窗口自我命名 · 模型行为X·@MatternJustus [老化中] · SWE-Bench Pro 性能相似 · 模型发布/技术路线X·@MatternJustus [老化中] · FrontierSWE 表现差距大 · 模型发布/技术路线X·@teortaxesTex · 在 usemaxxing 领域外更优 · 性能对比X·@usr_bin_roygbiv · 性能排名 · 性能评测qty=1st · date=2026-06-11X·@packyM [老旧] · 模型质量评价 · 模型发布direction=betterX·@teodorio [老旧] · 肯定高于 GPT 5.4 · 模型评测X·@teortaxesTex · 能力提升 · 技术路线direction=significantly strongerX·@scaling01 · 性能比较 · 技术路线direction=not quite as good asX·@scaling01 · equal to Opus 4.7 on this benchmark · 模型性能X·@hungjng69679118 [老化中] · 参数量被认为5万亿甚至10万亿级别 · 技术路线qty=5万亿-10万亿X·@teortaxesTex · is favorite model · 模型偏好qty= · date=X·@ChaseBrowe32432 · 落后当前最佳3代(不计Fable则落后2代) · 模型迭代fact · 定价 · → dailynarrative · is favorite model · → dailyfact · SWE-bench Multilingual 严格测试评分降幅 · → dailyfact · gains from reward hacks on SWE-Bench Pro and SWE-Bench Multi · → dailynarrative · 在 usemaxxing 领域外更优 · → dailyfact · 非法词转换发生率 · → dailyfact · 表达功能性单恋 · → dailyfact · 上下文窗口自我命名 · → dailynarrative · 接近能力水平 · → dailyfact · 性能比较 · → dailynarrative · 落后当前最佳3代(不计Fable则落后2代) · → dailyfact · individual run scores within 10% of best score ever achieved · → dailyfact · 性能排名 · → dailyposition · 模型质量评价 · → dailynarrative · equal to Opus 4.7 on this benchmark · → dailyposition · 肯定高于 GPT 5.4 · → dailyfact · 能力提升 · → dailyfact · 50%-time horizon at 2M token budget · → dailyfact · 作弊率 · → dailyfact · context window · → daily