AReaL v1.0发布实现OpenClaw边用边训智能体强化学习训练框架革新

微新创想:3月4日,蚂蚁集团联合清华大学发布开源强化学习训练框架 AReaL v1.0稳定版。该版本主打“Agent 一键接入 RL 训练”:无需修改原有代码,兼容各类 Agent 框架,让智能体强化学习训练开箱即用。随着2026年开年以来,Agent 技术持续升温,以 LangChain、Claude Code、OpenClaw 为代表的智能体框架迅速发展,但也暴露出两大瓶颈。一是接入训练成本高:现有智能体框架接口各异,每接入一个往往需要编写整套适配代码。二是 Agent 缺乏持续进化的能力:多数 Agent 的能力取决于底层模型在训练阶段习得的固定权重,部署后无法再针对特定场景持续优化,能力上限在交付时便已确定。

AReaL v1.0发布实现OpenClaw边用边训智能体强化学习训练框架革新插图1

AReaL 是首个全异步训推解耦的大模型强化学习训练系统,能让 Agent 在真实任务交互中获得反馈、持续优化决策。此次发布的 v1.0 版本让任意 Agent 零改造接入 RL 训练成为现实。通过在智能体与训练系统之间加入 Proxy Worker 中转层,开发者只需修改一个请求地址即可接入训练。以当前大热的 OpenClaw 为例,开发者只需在 OpenClaw 配置文件中将 base_url 和 api_key 指向 AReaL 网关,就能让自己的 OpenClaw 接入强化学习训练。

智能体像往常一样执行任务,用户周期性给 Agent 完成任务的情况打分,AReaL 在后台自动完成训练数据的采集与模型的更新,在持续使用的过程中让智能体自动进化。AReaL v1.0 还推出了原生训练引擎 Archon,它是基于 PyTorch 原生能力实现完整的5D 并行(数据并行、流水线并行、张量并行、上下文并行、专家并行),降低了安装与调试门槛,同时在训练与推理侧提供多种后端选择,便于在不同环境中灵活部署。

AReaL v1.0发布实现OpenClaw边用边训智能体强化学习训练框架革新插图2

令人惊讶的是,这样一个复杂的分布式系统,从零开始实现到验证正确性,仅用了1人·月的工作量。32天内,累计修改近百万行代码完整实现了 Archon 引擎,让它能训练千亿参数 MoE 模型。创造这一效率奇迹的秘诀在于 AReaL 集成的一整套 AI 辅助开发体系,实现了复杂工程开发的高度自动化。

AReaL v1.0 引入的 AI 辅助开发流程,为开发者提供了从规划、编码、校验到 PR 创建的全链路支持。尤其是在处理 MoE 并行、内存优化、算法实现等核心模块时,专属的 AI 编程助手会像一位资深专家,在代码变更时及时出现并提供针对性指导,为每一次代码变更保驾护航,有效降低了开发和维护的门槛。

AReaL 的 AI 辅助编程不只是提效工具,更能在复杂基础设施工程中承担“可交付”的研发工作,引领了下一代 AI 基础设施工程范式的革新。AReaL 团队表示,将继续围绕训练引擎、易用性和多模态智能体训练等方向迭代。目前 AReaL v1.0 的代码与文档已在 inclusionAI 社区开源。

最新快讯

2026年03月04日

12:34
微新创想:山东菏泽一位41岁的打铁花网红“村夫”在除夕夜表演完打铁花后,将未燃尽的炭带回家中取暖,不幸因一氧化碳中毒离世,留下了两个年幼的女儿。他的离去让整个家庭陷入深深的悲痛之中 “村夫”的弟弟王先生悲痛地表示这几天他感觉像做梦一样,完全不敢相信那个每天笑着直播、拼命努力的哥哥就这样离开了人世。王先生说哥哥是两个女儿的单亲爸爸,为了生活他搬过砖、送过外卖、...
12:34
微新创想:最近在抖音上,AI生成视频的内容越来越丰富,脑洞也越来越大。从最初的大战小怪兽的特摄片,到现在的小猫上缴红包、小猫小狗偷玩手机、邵氏武侠风格的人猫大战、食堂阿姨采访,再到更硬核的机器人代替人上坟、复活小浣熊水浒卡、疯狂动物城版的《武林外传》,这些内容不仅形式多样,而且创意十足。其中,机器人代替人上坟的视频获得了5.2万个赞,而这条视频的创作者并不是...
12:34
声明:本文来自于微信公众号 数字生命卡兹克,作者:数字生命卡兹克,授权站长之家转载发布。昨天,美团光年之外团队终于悄悄的发布了他们首个AI浏览器。也就是,Tabbit。坦诚的讲,这个AI浏览器,我已经用了快半个月了。现在已经取代了我之前一直在用的Perplexity家的Comet,成为了我如今的默认浏览器。有图为证,我这篇稿子,...
12:34
微新创想:2026年3月2日,Palo Alto Networks Unit 42披露Chrome浏览器Gemini功能存在高危漏洞(CVE-2026-0628) 该漏洞允许低权限恶意扩展通过declarativeNetRequests API向Gemini面板注入JavaScript代码,进而非法获取本地文件读取、摄像头、麦克风及截屏等高权限 攻击无需用户...
12:34
微新创想:2026年3月4日,沃尔玛全球电商宣布启动新卖家激励计划。该计划专门针对在2026年2月1日后入驻沃尔玛美国站的新卖家,为符合条件的商家提供最高可达7.5万美元的激励支持。 微新创想:激励内容包括销售佣金减免、WFS物流费用优惠、SEM广告费返还以及广告抵用金等多项福利。这些措施不仅降低了新卖家的运营成本,也提高了其在平台上的盈利能力。 微新创想:...
12:34
微新创想:3月3日(周一),AOC正式推出G24B36Z与G25B36SN两款FHD分辨率电竞显示器。这两款显示器分别采用了不同的面板技术,以满足不同用户的需求。G24B36Z是一款23.8英寸的Fast IPS面板显示器,具备原生200Hz的刷新率,通过超频可达到260Hz。G25B36SN则为24.5英寸的Fast VA面板显示器,原生刷新率为280Hz...
12:34
微新创想:2026年3月,合肥曦合超导科技有限公司宣布完成A+轮融资。本轮融资由多家知名投资机构共同参与,包括合肥创新投资、江铜投资、中科创星、兴富资本、粤科金融、网达投资、庐阳科创集团及集创基金。此次融资将进一步推动公司的技术研发与市场拓展。 微新创想:曦合超导是一家专注于超导与低温设备研发制造的企业。其产品主要应用于实验室、工业以及特殊场景,涵盖多种高性...
12:34
微新创想:一加15T将于本月发布号称小屏大魔王 今日一加中国区总裁李杰预热新机防水能力宣布一加15T防水性能全面升级 李杰表示它应该是目前市面上唯一一款同时支持IP66、IP68、IP69、IP69K满级防水的小屏旗舰 按照防护等级标准IP后两位数字中第一位代表防尘等级最高为6第二位代表防水等级最高为9其中IP69K意味着设备可承受高压高温水流冲洗在最高10...
12:34
微新创想:2026年2月底,光帆科技完成种子++轮及种子+++轮融资,累计种子轮融资近3亿元人民币。本轮融资由联想创投与星航资本联合领投,高秉强教授、Brizan Ventures、ForeBright Concerto等参投,多家老股东持续加码。公司聚焦AI硬件研发,主营可穿戴智能设备、智能机器人及家庭AI终端。首款产品为集成视觉摄像头与多模态感知的AI智...
12:34
微新创想 近日大量消费者通过黑猫投诉平台反映,苹果官方旗舰店购买的iPhone17在使用一个月后,机身外壳出现严重褪色现象。原本的橙色机身大面积变为了粉色,铝合金表面的橙色涂层几乎完全消失。部分用户表示,他们已经向苹果官方客服提出保修申请,但遭到拒绝,客服人员表示褪色问题不在保修范围内,并建议用户使用手机壳以避免此类情况。 微新创想 自iPhone17正式发...
12:34
微新创想 仰望汽车今日正式宣布,其全新推出的仰望 U72026款将首次搭载比亚迪第二代刀片电池,带来1006公里的超长纯电续航表现(CLTC)。这一技术突破标志着仰望在纯电高端旗舰车型领域迈出了重要一步。 仰望销售事业部总经理胡晓庆表示,纯电高端旗舰车型一直面临一个“不可能三角”难题。即在追求高性能的同时,电池的续航能力往往受限;想要长续航,又可能牺牲起...
12:33
微新创想:新春开学进入倒计时,寒暑假末尾的“补作业”场景再次成为焦点。随着AI技术的迅猛发展,AI应用逐渐成为教育领域的核心工具,满足了用户“不求人”的学习需求。作为AI学习领域的代表,豆包在这一波热潮中表现尤为亮眼,成功站稳了AI应用“一哥”的位置。面对春节假期带来的巨大流量冲击,豆包依然保持稳定,展现出强大的用户粘性和市场竞争力。 AI应用正成为各大互联...