扫描下载APP
其它方式登录
文章探讨世界模型领域头部公司AMI Labs和World Labs为何普遍保持高度保密,指出其技术虽具机器人、自动驾驶、交互视频等广阔商业化潜力,但因概念宽泛、融资环境宽松及避免过早引发竞争,企业主动延迟披露产品路径,将沉默视为关键战略。
Claude Code于9月19日起原生支持OpenAI推出的AGENTS.md项目指令格式,结束长期仅支持自有CLAUDE.md的格局;此举旨在解决开发者需重复维护两份高度相似文件的痛点,并通过Mod插件系统增强扩展性,功能设计上亦显现出向DeepSeek等竞品借鉴的趋势。
Anthropic旗下Claude Code工具从2.1.277版本起支持OpenAI主导的AGENTS.md项目指令标准,允许在无CLAUDE.md时自动读取AGENTS.md,降低跨AI编码工具协作的配置成本,推动AI Agent项目上下文标准化。
World Labs发布的多模态世界模型Atlas,通过3D几何重建技术将普通照片转化为可被程序直接解析的三维空间数据(如点云、3D高斯泼溅),显著降低机器人仿真环境构建门槛;其核心突破在于以空间坐标替代像素理解,实现从‘生成画面’到‘交付世界’的范式转变,并正通过收购SceniX补全物理仿真能力,推动具身智能向真实-仿真-真实闭环演进。
李飞飞创立的World Labs发布多模态世界模型Atlas,仅需少量手机照片即可实现高保真3D重建与空间一致的相机控制,突破传统3D重建高成本瓶颈;其核心价值在于构建可交互、可推演的‘世界模拟器’,为具身智能提供低成本仿真训练环境,推动机器人从实验室走向现实应用。
Claude Code团队分享其在快速技术迭代下的工作范式转变:从逐行审查AI决策,转向以目标为导向、信任驱动的协作模式;通过构建可组合的抽象原语(如Permissions、Visualizations等)应对模型能力月级跃迁,强调工程师核心始终是问题解决而非固守具体实现。
Scalabot公司发布HERON-World Model,首个可预测多智能体交互后果的世界模型,支持基于输入画面与动作指令生成未来状态视频,在物理规律、状态记忆和多智能体协同预测方面表现突出,采用真机、仿真与Ego视频多源数据融合及MoT+MoE混合架构实现高效推演。
生成式AI竞争正从二维内容升级至可实时交互的3D空间,OpenAI、Anthropic、字节跳动(Seedance)及World Labs分别依托大语言模型、视频模型和原生世界模型三条技术路径,聚焦3D内容生产、实时虚拟环境与空间一致性重建,推动内容产业向‘可进入、可交互的空间’转型。
李飞飞团队推出的Atlas模型以“新视角预测”为核心,融合生成、重建与模拟能力,仅需几张照片或三部手机拍摄即可实现三维场景重建和‘子弹时间’效果,推动空间智能发展,为创作、设计及机器人仿真提供基础支持。
Anthropic旗下约20人的Labs团队采用两周一次快速评估机制,允许高达80%的想法失败,聚焦孵化高潜力AI产品如Claude Code、MCP和Claude Design;该机制强调研究与产品双向反馈,推动模型能力向实际应用转化,并支撑公司商业化及上市准备。
World Labs发布新模型Atlas,以‘新视角预测’为核心原语,统一三维重建与内容生成,仅需少量照片(如三张)即可高精度重建物理空间,解决机器人领域因物理世界数据匮乏导致的落地瓶颈,推动空间智能发展。
文章介绍Code World Model——一种新型世界模型范式,由西湖大学AGI Lab与南洋理工大学提出。该模型将语言模型作为‘大脑’驱动代码维护可执行世界状态,视频模型负责生成视觉画面,实现语义逻辑与视觉表现的解耦,推动可交互视频世界向真实、可控、因果连贯的方向发展。
李飞飞联合创立的World Labs发布全球首个多模态世界模型Atlas,其核心能力是「新视角预测」——通过少量图像输入,理解空间几何关系,生成或重建任意虚拟相机位置所见的画面,统一生成与重建任务,显著降低3D采集成本,并支撑影视、游戏、建筑设计及机器人仿真等应用,被视为通往空间智能与AGI的基础原语。
李飞飞创办的World Labs发布全球首个多模态世界模型Atlas,具备原生处理文本、图像、视频、相机位姿与3D深度信息的能力,支持相机控制生成、空间重建和时空模拟,显著降低高精度三维场景构建门槛,目标赋能具身智能与机器人仿真训练。
西湖大学与南洋理工大学团队提出Code World Model,将世界演化与视觉生成解耦:Coding Agent作为‘大脑’通过可执行代码维护持久世界状态并驱动因果演化,视频模型则基于轻量级Proxy条件生成高保真视觉观测,为开放式世界模型提供新范式。