扫描下载APP
其它方式登录
周伯文团队联合提出NatureBench基准,用于评估AI coding Agent在Nature系列期刊真实科学论文核心实验中的复现与改进能力。该基准涵盖90个跨学科任务,通过NatureGym自动化流程构建,并设置信息防火墙防止直接复现。实验显示当前最强AI Agent仅在17.8%任务中明确超越原论文SOTA,整体能力有限但已在部分领域(如关系推理)接近人类水平。