扫描下载APP
其它方式登录
AI编程工具正从开发者专用的Copilot模式升级为面向全员的Agent模式,逐步渗透至企业办公场景,成为‘数字员工’。Cursor、Anthropic、OpenAI及国内阿里、腾讯、字节等纷纷推出办公型Agent产品,但落地面临隐性知识建模难、流程模糊、Token成本飙升及价值衡量缺失等挑战,需重构组织工作流与成本管理体系。
清华大学KEG实验室提出单rollout异步优化(SAO)方法,通过单rollout采样、直接双边重要性采样、高频价值模型更新、固定注意力参数等机制,显著提升长程Agent训练稳定性与效率,在数学推理、代码任务和模拟在线学习中均超越GRPO等基线方法,并已部署于GLM-5.2 Agent RL训练流水线。
文章阐述Agent经济与链上经济融合重塑全球经济体系:AI智能体颠覆企业组织形式,降低认知与交易成本;区块链提供可编程、确定性结算的经济操作系统;稳定币作为机器可持有、高速流转的货币基础;三者共同构成生而全球的三层架构,推动价值创造与流转方式的根本变革。
2026年上半年AI应用市场呈现结构性变革:AI原生App月活达4.99亿、同比增长85.4%,用户黏性显著提升,豆包、千问、DeepSeek构成头部梯队;AI Agent加速落地,分化为终端系统型、生态办事型、办公交付型和自主代理型四类路径;传统APP面临功能原子化(Skill化)与内容供给化趋势,移动互联网底层逻辑正被AI驱动的‘服务找人’和‘被AI引用’新分发范式重构。
AI Agent正从辅助工具转向自主参与经济活动,尤其在加密资产财税场景中引发责任归属问题。FinTax与Stair AI合作构建可追溯、可验证的AI财税基础设施,通过执行账本和结构化知识沉淀,解决AI决策黑盒、语境缺失与责任难溯三大瓶颈,推动AI进入财税核心流程并支撑合规监管。
Fable 5在远程劳动力指数(RLI)中实现16.1%自动化率,远超Opus 4.8和GPT-5.5,反映AI代理在真实商业自由职业任务中独立赚钱能力的加速提升;RLI基于240个Upwork真实项目,以人类评审判定交付物是否达到付费客户可接受标准,强调经济价值而非单纯技术指标。
作者使用字节跳动推出的AI IDE工具Trae,尝试将一年前混乱的22个AI工具测评Excel数据清洗并搭建为可筛选排序的网页档案库。过程中发现Trae在环境搭建、架构设计和工程意识上表现优秀,但存在过度理解需求、模糊匹配误删数据、上下文易饱和、代码债务累积等问题,适合快速原型开发,但长期项目需人工严格把关。
文章探讨大模型进入Agent时代后国产AI与海外产品的体验差距,指出国产模型在中文理解、长文本处理、代码推理等局部能力已领先,但在多模态生成(尤其文生图)、端到端自主执行物理世界任务、以及支撑深度推理的商业模式(如付费生态与算力投入)上存在系统性短板,导致用户倾向选择海外Agent。
文章分析Grok 4.5发布背后的商业逻辑转变:模型竞争焦点从榜单分数转向真实工作流中的成本效率与可计费性,强调coding agent时代IDE成为新入口,评测权、入口权和计费权正整合为统一战场,中美厂商均围绕token经济性与工作流集成展开竞争。
Meta发布Muse Spark 1.1多模态推理模型,强化Agent能力,支持长上下文(100万token)、跨应用任务调度、计算机操作、代码生成与多模态理解,并同步开放Meta Model API公测;同时推进自研AI芯片Iris量产及7GW算力基建扩张,加速实现个人超级智能愿景。
研究团队通过SearchGEO评测框架,对13个主流大模型在检索增强场景下的抗操纵能力进行系统测试,发现模型安全性差异显著:Claude表现最稳但存在沉默漂移和误拒风险,GPT在常规任务中稳健却在agent技能推荐等新场景下近乎完全失守,Gemini等模型则易受合成共识攻击;研究强调需将搜索可靠性纳入核心安全评测,并针对‘模型+框架’组合设计防御。
翁荔提出AI自进化可优先从Harness(模型外部运行系统)入手,而非直接修改模型权重;Harness涵盖工具调用、上下文管理、任务拆分等能力,其自我优化已通过Weakness Mining、Harness Proposal和Proposal Validation等工程化路径验证,并在多个模型上提升任务表现;崔添翼附议该方向为重要突破口。
7月15日起,豆包、千问等大厂AI产品将下架拟人化聊天机器人功能,依据国家网信办《人工智能拟人化互动服务管理暂行办法》,重点整治情感诱导、危害未成年人及泄露敏感信息等问题;监管旨在淘汰消耗注意力的陪聊类AI,保留并鼓励提升生产力的工具型AI智能体,推动AI向办公提效、流程自动化和降低专业门槛方向发展。
字节跳动Seed团队发布EdgeBench评测平台,通过134个长时程任务(单任务至少运行12小时)、总计约3.8万小时Agent运行实验,首次发现Agent环境学习遵循高精度log-sigmoid Scaling Law(R²达0.998),揭示其学习过程具有可预测性、路径多样性、经验依赖性及学习效率持续加速等核心规律,推动AI评测从静态能力向动态成长能力范式跃迁。
文章对比分析开源AI Agent产品OpenClaw(龙虾)与Hermes(爱马仕),指出Hermes v0.18.0通过多智能体协作(MoA)、基于证据的自我验证、可编辑的学习循环(/learn、/journey)及后台子Agent等能力,显著提升任务可靠性与交付质量,为国产Agent发展提供从‘卷功能’转向‘卷质量’的关键启示。