扫描下载APP
其它方式登录
研究团队推出AgentWorld评测基准,用于系统评估多智能体在长时程、角色不对称和黑盒交互环境下的协作能力;实验显示最强模型驱动的团队仅完成约50%的任务,揭示个体能力强不等于团队协作有效,强调需从动作依赖与因果贡献角度量化协作质量。