扫描下载APP
其它方式登录
前英伟达工程师Neil Movva指出当前AI行业陷入‘延迟陷阱’,过度追求聊天机器人的低延迟交互,导致GPU算力严重浪费;他主张转向长周期、后台运行的智能Agent,通过‘算力拾荒者战略’——优化非英伟达芯片、利用廉价绿电、接纳95%可用率机房等手段,大幅降低token成本,推动智能成为廉价大宗商品。
前OpenAI核心研究员Jerry Tworek预言AI研究将快速自动化,人类研究员或两年内大规模退出前沿模型研发;他创办Core Automation公司推动AI实验室全自动化,指出全球仅30–50人具备端到端模型研发能力,Transformer架构创新停滞,未来人类工作重心将转向哲学思辨、终身学习与自我实现。
AI芯片公司Etched凭借专为Transformer推理设计的ASIC芯片Sohu,短期内估值飙升至210亿美元,并向领投方Jane Street交付首台推理机架;其技术聚焦极致推理效率与整机系统交付,但缺乏独立第三方测试验证,市场对其真实性能和量产能力存疑。
COLM 2026三篇论文分别从长上下文建模、反向传播梯度损耗、层剪枝对推理链影响三个角度,系统质疑Transformer架构中被广泛默认采用却未经充分验证的关键设计,揭示QK归一化、输出投影层、层剪枝等‘祖传’组件在特定维度存在显著性能代价,推动大模型基础架构的科学复验与重构。
AI本质上是一台基于Transformer架构、依赖大规模算力与数据的概率预测型超级计算机,其价值实现取决于硬件基础设施、大模型操作系统和应用层落地,而组织变革(人才选拔转向思考力、流程重构、私有数据沉淀)才是释放AI效能的关键底层动力。
美国AI芯片公司Etched同时推进两轮估值相差100亿美元的融资,凸显资本市场对专用Transformer架构ASIC芯片的狂热追捧;其SOHU芯片宣称性能远超英伟达GPU,但面临技术路径依赖、英伟达快速反制及行业竞争等严峻挑战,融资奇观背后折射AI基础设施赛道的焦虑与泡沫风险。
文章回顾Transformer模型诞生过程,聚焦Google八名研究者如何突破当时主流的循环神经网络范式,仅依靠自注意力机制构建全新架构。他们受神经科学中注意力‘撤出’机制和心理学经典理论启发,克服工程与认知惯性,通过多头注意力、缩放点积等创新实现并行化与长程依赖建模,最终以更低计算成本超越LSTM,在机器翻译任务上取得突破性成果。
研究提出锥形语言模型(TLMs),通过在总参数量不变前提下将前馈网络容量从前到后单调递减(如余弦曲线)重新分配,显著提升模型性能:困惑度降低1.84点、常识推理准确率提高,且适配多种架构与规模,无需新增参数或计算开销。
文章追踪《Attention Is All You Need》八位共同作者九年来的职业轨迹,揭示他们全部离开谷歌后分散至OpenAI、Anthropic、英伟达、Cohere、Sakana AI、Inceptive、Essential AI及NEAR Protocol等机构,分别投身大模型研发、生物科技、AI创业、演化算法、企业级AI服务及区块链等领域,体现Transformer奠基者持续探索下一代AI架构的多元路径。
谷歌AI传奇人物Noam Shazeer离开Google DeepMind,加入OpenAI担任架构研究负责人。他是Transformer架构共同作者、MoE技术先驱,曾主导Gemini研发;其跳槽被视为AI人才争夺战的关键事件,对OpenAI技术实力和谷歌大模型进展产生显著影响。
谷歌DeepMind论文指出Transformer架构存在固有的拓扑缺陷,难以有效追踪内部状态,导致模型在连贯推理中频繁出错;思维链(CoT)只是掩盖该缺陷的高成本补丁,而非根本解法;论文主张回归循环机制,探索序列方向循环的状态空间模型(如Mamba、RWKV-7、DeltaNet)以实现高效、持久的状态维护。
文章以Transformer论文作者卢卡斯·凯泽的视角,反思当前大语言模型在泛化能力、学习效率和底层机制上的根本局限,指出其依赖海量数据的‘外星人式’泛化与人类学习方式背道而驰;强调行业正加速转向Agent落地与工程化,并探讨后Transformer架构、强化学习、代码智能体(如Cursor)及多模态等前沿方向,呼吁科研保持对未知领域的勇敢探索。
研究团队首次从数学上严格证明隐式思维链(ICoT)的有效性,提出Log-ICoT训练方法,通过树状结构分层隐藏推理步骤,使Transformer模型在不输出中间token的情况下仍能完成复杂推理,显著降低推理延迟与计算成本。
牛津大学、英伟达等机构提出KV-CAT新训练范式,通过在模型预训练阶段引入压缩感知机制,使Transformer模型天然生成更易压缩的KV缓存表示,从而显著提升后续KV压缩效果,同时不损害基础语言能力,解决长上下文推理中的显存瓶颈问题。
卡内基梅隆大学与马里兰大学提出大模型‘睡眠机制’,模拟人脑海马体在睡眠中巩固记忆的过程,让模型在上下文过载时暂停输入、离线多轮处理历史信息,压缩进快速权重并清空缓存,从而显著提升深度推理任务性能,尤其适用于长逻辑链、高记忆负载的复杂问题。