爆火了的Muse和 Instinct们不能做的,OS3能?

字母AI
个人专栏
热度: 3710

文章对比分析Muse、Rabbit r1及OS3等Personal Agent产品的发展路径:Muse依赖大厂资源推动平台合作,而Rabbit通过OS3转向用户本地设备接入、多设备协同与持续对话交互,解决云端Agent面临的平台限制、环境迁移和上下文管理难题,探索更自主、可积累、高可用的下一代个人智能体。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

小扎拿出Muse Charm之后,Rabbit r1又被翻了出来。

不少人看到这款新设备时,都会幻视两年多前的橙色小方盒。在X上,有人将小扎拿着Charm、吕骋拿着r1的照片放在一起玩梗,不少外媒在报道Charm时,也都提到了这款初代AI硬件。

Rabbit

一台可以随身携带的小设备,通过语音听懂用户的要求,再让AI替人办事。这幅画面,确实让人觉得熟悉。

让人感到熟悉的不只是硬件。

2024年,Rabbit在r1发布会上,用打车、订票、点外卖等场景,向大众解释Personal Agent(个人智能体)到底能办什么事。此后,这几样任务反复出现在一代代Agent产品的演示里,逐渐凑成了一套观众熟悉的“标准套餐”。评测网站Assistant Benchmark也把订机票、订餐厅、购物等列进了Personal Agent的测试维度。

这套题目受欢迎的原因不难理解:外卖有没有送达,票有没有订上,买东西有没有省钱,交付结果明确。比起解释模型又提升了多少分,这些场景更容易让人看懂,AI究竟能替自己做什么。

但最容易演示、传播的任务,难道就是Personal Agent最有价值的用武之地吗?

大公司想让AI下单,也难

Muse爆火以后,很快遇到了平台的阻力。

当地时间9月20日,亚马逊表示已阻止Muse代表用户在其网站购物。亚马逊称,Meta未事先告知Muse会访问其网站,Muse浏览时也未标明代理身份,并对其处理用户凭据的方式提出隐私和安全担忧。

Rabbit

从技术角度来看,采用云虚拟机的Personal Agent方案,已经有过很多被禁止访问的案例。吕骋在接受科技媒体WIRED的采访时也提到:“这些,我们一年半以前就经历过了。”

AI能否稳定完成操作、替人下单,和是否获准操作,是两个问题。有时即使Agent知道该怎么操作,平台也未必放行,商业准入及背后的利益分配同样可能卡住订单。

平台担心的,除了账户安全和交易责任,还有自己的生意。

过去,用户在平台上搜索、比较、看推荐,平台从中赚取广告费和交易佣金。如果这些过程都交给AI,用户可能只记得自己的Personal Agent,不再关心订单来自哪家平台。平台可能失去影响用户选择的机会,广告和佣金的议价能力也会受到挑战。

Muse受到关注后,Airbnb、Booking、Expedia等旅游公司股价承压,就反映了市场对这种变化的担忧:未来的交易入口,究竟掌握在平台手里,还是Personal Agent手里?

Muse的解决方式,是借助大公司的资源和影响力,构建起一套Agent友好的商业生态。

在被亚马逊拒绝后,Muse与美国买菜平台Instacart宣布合作。旅行技术公司Duffel也宣布,美国Muse用户已可查询实时机票库存和价格,处理预订、取消及后续行程。

在用户端,Muse提供免费使用额度,吸引更多用户使用,先让用户体验Personal Agent的成果,再逐渐培养习惯。

让更多平台接受Agent,需要处理商业准入、利益分配和交易责任,也需要持续投入。Meta这样的大公司,有资源吸引用户,也有能力影响生态。Muse火起来的意义也在这里:推动更多服务接入,让Personal Agent有更多可用的场景。如果这些合作能带来更广泛的开放,也会为其他团队创造机会。

但资源有限的创业团队,很难照搬大公司的投入方式。它们更需要靠技术和产品创新,争取生存和发展的空间。

创业公司的方案

吕骋曾在采访中提到,只有15人团队的Rabbit,会通过Action Model的多次迭代来完善Personal Agent的能力。

2024年1月,随着r1的发布,Rabbit的第一代LAM上线,当时只能通过r1使用;10月,Rabbit单独推出了LAM playground,可以在网页端使用,Agent能根据用户要求浏览网页、查找信息和执行操作。

按照当时的技术说明,它会结合页面截图和网页结构,判断可以点击的位置,并随着页面变化调整下一步行动。遇到陌生网站,Agent会自己找到入口,把目标拆成操作步骤实现——这也是目前大部分Personal Agent仍采用的技术路线。

2025年2月,Rabbit发布了Android Agent研究预览,将AI的操作范围扩展到安卓应用和设备的系统功能。几个月后,有AI手机沿用了这套技术路线,结果被各大App禁止访问了。

直到今年初,Rabbit把LAM升级为DLAM,让Agent接入用户自己的Windows和Mac电脑,在获得授权后操作浏览器和桌面软件。

这套方案的效果是,通过真实设备执行任务,能够有效减少云端代理访问时遇到的限制。执行环境也由云端虚拟机延伸到用户自己的电脑,原来安装的软件、保存的文件和进行中的项目,都可以由Agent直接使用和处理。

从这些发布时间看,Rabbit在Personal Agent的探索一直在行业领先。到了OS3,Rabbit又开始整合这些能力,探索下一代Personal Agent还需要解决什么问题。

OS3的新探索

就在Muse Charm亮相的前一天,Rabbit发布了OS3。

用户不必先买一台r1。打开网页,连接自己选择的模型和电脑,就可以让OS3使用现有的文件、软件和工具处理任务。一个账户最多连接五台设备,用户也可以通过iMessage、Telegram或r1进行交互。

这次发布演示的一项重点,是让用户一次交代多项任务,看Agent能否接得住。

Rabbit

吕骋一口气提出了几个要求:找一本哲学书,制作阅读指南,通过Slack发给自己;研究利物浦足球俱乐部,生成交互网页;再做一份Agent竞品分析,顺便给OS3写一本使用手册。

说完,他让OS3拆分任务、开始执行,自己在同一个对话里接着提问。

一个直观的交互变化,是OS3的网页主界面采用持续对话。用户可以在同一个对话里交代多件事,多个任务能在同时后台执行,互不干扰,用户自己还能继续提问,或者补充、修改前面的要求。

用户少做的安排,成了系统需要解决的问题:哪句话是新任务,哪句话在修改旧要求,“刚才那份文件”指的是哪一个,需要调取哪些已有信息。持续对话的意义,在于把一部分任务组织和上下文管理交给系统。

Rabbit押注的是:个人助理应该能接住随时出现、不断变化的交代,让用户少花时间整理提示词和管理会话。

这个方向也有其它产品正在探索。Claude Code近期开始测试的新版Projects,同样让用户在一个主对话中提出需求,由AI拆分并协调后台任务。

OS3还把这种安排延伸到了用户连接的设备上。听懂要求、拆好任务之后,它还得判断:需要哪些文件和工具,应该去哪台设备干活。

这涉及到Rabbit的第二个技术下注:接入用户已有的工作环境,并智能协调多台设备。

云端虚拟机有一个很直接的好处,那就是让用户可以关上电脑,任务留在云端继续执行。但除了平台访问的限制,还有另一项体验成本:用户需要把自己的工作搬进这个新环境。为了让Agent开始干活,用户需要在虚拟机重新登录账户、上传材料、配置工具。

但在用户自己的电脑里,这些东西早已存在:做到一半的项目、安装好的软件、几轮修改过的文件,以及长期积累的资料。

Rabbit

接入用户已有的设备,可以让Agent用上现成的文件和软件,减少重新准备工作环境的成本。

不过,接入用户的电脑,也意味着任务会受到设备状态的限制:电脑休眠或断网,在这台电脑上执行的任务就会停止。

OS3采取的解决方案是,它支持连接最多五台设备,包括本地电脑、办公室机器,以及用户自己的云虚拟机。

如果任务需要某台电脑上的软件,就在那里操作;需要长时间运行的任务,则可以安排在持续在线的设备上。用户可以指定执行位置,也可以由系统根据任务智能选择某台设备,或在多台开机的设备间接力完成任务。

例如,OS3可以自动找到在A电脑上的视频,然后使用有专业编辑软件的B电脑完成剪辑,再到登录账号的C电脑完成上传。能在多台设备间分配任务、接力执行的能力,目前似乎还没有其他Agent实现。

在实际使用时,我们尝试让OS3完成一项资料收集任务:调研Muse Charm并整理成报告,完成后发消息到手机。约15分钟后,手机就收到了OS3通过iMessage发来的完成通知,消息中列出了调研内容和报告在iCloud中的保存位置。

Rabbit

Muse由Meta自家的Muse Spark驱动,OS3则支持接入不同的模型服务,也可以使用本地模型。模型更新很快,用户可能因为能力、速度或价格,决定换一家服务。

国内的几家模型也都支持接入,我们在测试时使用了阿里的Qwen,表现非常好。

按照Rabbit的设计,更换模型后,此前积累的记忆、配置的技能和连接的设备可以保留。OS3本身免费,使用云端模型需自备受支持服务的API密钥,并按用量付费。

Rabbit希望OS3能承接这部分积累,底层模型可以更新,用户与Personal Agent之间已经建立的工作关系继续保留。一个Personal Agent逐渐知道你在做什么项目、习惯怎样处理文件、哪些事情此前已经讨论过,这些积累不应该随着模型更换而作废。

我们在Rabbit 的Community里了解到,Rabbit OS3上线三天内,新用户累计已成功完成超过1万个任务,用户使用自己的API key每天消耗总量近10亿token,人均水平远高于大部分Agent类产品。

一个长期使用的Personal Agent,还需要能核实任务结果,并把用户的反馈用到下一次工作中,让上次被纠正过的错误,下次能够避免。只有当用户越来越少地重复交代、检查和返工,Agent才真正替人省下了时间。

模型进步能提升理解和执行能力,平台合作能带来更多可用的服务,而如何用好这些能力,仍需要产品不断探索。

下一代Personal Agent,既需要生态为它打开更多可能,也需要一个个具体的创新,让它真正好用。

本文来自微信公众号“字母AI”,作者:袁心玥

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。