扫描下载APP
其它方式登录
何恺明团队提出VISTA框架,通过将ARC-AGI-3测试中的数字输入替换为原始图像,并引入无损视觉记忆‘相册’机制,显著提升大模型在零样本、无说明交互式像素游戏中的推理与通关能力;Claude Opus 5和GPT-5.6 Sol分别实现100分满分和99分近满分,验证‘视觉感知’与‘显式记忆’对AGI能力的关键作用。
何恺明团队提出极简文生图模型MiniT2I,摒弃VAE、AdaLN条件注入、私有数据及RL/DPO对齐,直接在像素空间训练,仅用258M参数和公开数据即在多项基准上超越更大模型,验证了文生图从‘堆料’向‘提纯’的范式转变。
何恺明团队提出嵌入式语言流(ELF)模型,通过在连续嵌入空间中进行流匹配去噪、仅在最终时间步解码为离散token,显著提升连续扩散语言模型性能;ELF以更少采样步数和十分之一训练token量,在文本生成、机器翻译和摘要任务上超越现有扩散模型。
何恺明团队推出新型扩散语言模型ELF,采用全连续embedding空间去噪、仅在最后一步离散化输出的创新架构,以105M参数、45B训练token和32步采样,在生成困惑度等指标上超越主流扩散语言模型,验证了连续扩散路径的有效性与高效性。