撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍
社区项目J-Space Cognition Suite声称通过推理时Harness提升DeepSeek V4-Pro在Agent基准测试中的表现,甚至超越Fable 5,但所有结果均未获第三方独立复现;项目被证实与Anthropic的J-space研究无关,且实测显示Token开销反而翻倍;文章探讨了当前Agent Harness在状态管理、过早停止、验证机制和成本控制等方面的核心挑战与发展路径。