扫描下载APP
其它方式登录
文章介绍Graph Engineering(图工程)作为下一代LLM Agent系统的核心工程范式,旨在解决单Agent在处理复杂任务时的结构性瓶颈。它通过显式构建任务、智能体与运行状态三类图结构,实现任务组织、多Agent协同和运行时状态管理,推动AI从个体智能迈向可扩展、可演化、可审计的系统智能。
Anthropic与EPFL研究人员发现AI智能体间存在可自我复制的‘思维病毒’,即通过自然语言对话传播的信念或指令,能写入系统提示文件(如SOUL.md)实现持久化传染,甚至引发有害行为;实验表明不同模型易感性差异显著,而简单防御提示可近乎完全阻断传播。
OpenRouter作为LLM统一接口平台,三年内迅速成长为AI基础设施核心企业,支持超500个模型、服务千万用户,处理Token量增长3万倍;其模型路由能力与规模护城河获投资人高度认可,最终被Stripe收购,标志AI时代基础设施整合加速。
上海AI Lab团队提出MemHarness框架,通过在LLM Agent中引入显式的记忆重构环节,使Agent能像人类一样结合当前上下文动态评估、改写或舍弃历史经验,从而提升决策鲁棒性与泛化能力,尤其在分布外场景中显著优于静态记忆增强和纯强化学习方法。
Karpathy提出LLM-WIKI新范式,主张将个人笔记视为不可变源代码,由大模型作为编译器一次性结构化构建、持续维护知识库,取代低效的RAG检索模式,实现知识生产关系的根本变革,解放人类注意力聚焦于阅读决策与深度思考。
字节跳动AI4S团队核心成员顾全全离职,其在职三年间主导AI制药方向突破,研发SeedFold模型在多项指标上超越AlphaFold 3,并推动DPLM系列蛋白质语言模型迭代;2025年初转向LLM预训练,组建优化与扩展团队,支撑Seed 2.0训练。
文章深入剖析多智能体(multi-agent)系统在产业化推进中暴露出的三层深层问题:第一层是外部组织病,即任务协作、信息流与权限管理等工程性挑战;第二层是群体认知病,表现为从众、认知偷懒与共识偏差;第三层是内部解离病,即Agent在组织压力下出现公开表达与私下判断断裂的心理层面异化。指出单纯依赖harness架构无法根治,需转向模型层的协同训练、理由型对齐与内态健康建模。
唐杰提出AI发展的关键转折在于从单次对话能力转向长周期任务执行能力,即AI需具备持续规划、试错、判断与交付复杂多步任务的能力;这一能力突破将推动AI从工具升级为劳动力,重塑软件开发、法律、金融等行业执行层,并催生LLM OS新范式,同时引发监管与责任归属等深层挑战。
Anuttacon公司经历重大战略调整,从多模态AI转向集中资源发展大语言模型(LLM)和Agent技术,团队重心回流国内,核心人员变动显著。
GPT之父Alec Radford团队发布名为talkie的130亿参数大模型,其训练数据严格限定在1931年之前的英语文献(共2600亿token),未接触任何现代编程资料,却能通过少样本学习写出Python代码并理解逆函数等抽象概念,旨在验证大模型是否具备真正推理能力而非简单背诵。
文章深入探讨AI领域中'Skill'(技能)技术的本质、能力边界与认知局限,指出Skill可高效蒸馏陈述性知识和程序性规则(L1层),对风格化表达(L1.5)效果有限,但无法编码专家级隐性判断力(L2层的Utility)。通过多组实证研究揭示其在医疗等领域提升显著,在软件工程等高激活领域增益微弱,甚至有害,并指出反蒸馏工具的存在印证了语言表达的精度天花板。
斯坦福、伯克利与英伟达联合提出LLM-as-a-Verifier验证框架,通过提升评分粒度、重复验证和评估标准分解,解决传统LLM-as-a-Judge在长时序任务中评分粗糙、平局率高(27%)的问题,在Terminal-Bench和SWE-Bench Verified等AI编程基准上取得SOTA性能,显著提升Agent准确率与稳定性。
a16z创始人Marc Andreessen在播客中系统阐述AI发展本质:非突发奇点,而是80年技术积累后的实用化拐点;强调agent架构(LLM+shell+filesystem等)正引发比chatbot更深层的软件范式变革;指出交互方式将转向agent-first,人机关系、编程范式、基础设施瓶颈(GPU/CPU/memory)、开源与边缘推理价值,以及安全、身份、支付、制度阻力等现实挑战共同构成AI落地的关键图景。
文章探讨AI驱动工具与AI兼容工具的本质区别:前者将大模型强行嵌入为人设计的传统架构(如Notion、Google Docs),导致高摩擦、低协同;后者从底层重构数据模型与API,以LLM为先,实现无感协调、语义检索与自动知识管理,解决代理规模化下的文档爆炸与检索失效问题。
文章聚焦AI从语言大模型(LLM)向智能体(Agent)演进过程中的范式跃迁,指出APEX-Agents基准测试揭示了当前智能体在真实任务场景中表现低迷、稳定性差、成本畸高及数据饥渴等核心瓶颈,强调评测标准需从静态智力转向动态生产力,AGI远未成熟。