阿里云通义实验室近日正式宣布开源其自主研发的突破性AI智能体项目WebAgent,其中旗舰组件WebShaper和WebSailor在网络智能体领域引发全球瞩目。这款革命性AI工具凭借端到端的自主信息检索与多步推理能力,实现了接近甚至超越人类专家的网络交互水平,为信息处理领域带来全新突破。

WebAgent:模拟人类搜索行为的智能体

WebAgent是阿里巴巴通义实验室精心打造的开源AI智能体,其核心使命在于模拟人类在网络环境中的感知、决策和行动循环。通过自主搜索和多步推理技术,WebAgent能够高效处理复杂、模糊的网络任务,为用户提供前所未有的智能搜索体验。该智能体包含多个关键组件,其中WebSailor和WebShaper的技术创新尤为引人注目。根据官方介绍,WebAgent能够主动检索学术数据库、新闻网站和专业论坛,精准筛选关键信息并生成结构化报告,广泛应用于学术研究、商业分析和日常查询等场景。

在权威评测集BrowseComp上,WebSailor-72B模型表现惊艳,超越了DeepSeek R1和Grok-3等知名闭源模型,仅次于OpenAI的DeepResearch,荣登开源网络智能体榜首。WebAgent还在GAIA和WebWalkerQA基准测试中分别取得60.19分和52.2分的卓越成绩,充分展现了其在复杂任务中的强大能力。

WebShaper:形式化驱动的数据合成新范式

WebShaper作为WebAgent生态的核心创新,提出了一种基于”形式化驱动”的数据合成方法,有效解决了AI在高不确定性任务中的推理难题。通过集合论构建信息搜索任务的数学化表示框架,WebShaper利用”知识投影”概念,将复杂搜索过程抽象为实体集合的操作。例如在查询”出生于90年代的球员在2004-05赛季为东德足球队效力”时,WebShaper能系统化地生成训练数据,确保AI在多步推理中保持高度准确性。

WebShaper数据集覆盖体育、学术、政治、娱乐等多个领域,其中体育类问题占21%,学术类占17%,确保了知识的广泛适应性。其逐层扩展策略有效避免了推理捷径和信息冗余,使AI必须通过完整推理路径得出答案。实验表明,WebShaper训练的模型在相同数据量下,性能显著优于WebWalkerQA和E2HQA等传统数据集。

WebSailor:复杂任务中的”超级网络侦探”

作为WebAgent的”大脑”,WebSailor是一个大规模语言模型,负责理解用户意图、制定浏览策略并决定操作步骤。其最新版本WebSailor-72B通过阿里云FunctionAI实现一键部署,用户仅需10分钟即可完成配置,极大降低了使用门槛。WebSailor在高不确定性任务中表现出色,尤其擅长处理模糊查询或需要跨平台信息整合的复杂场景。

WebSailor的训练采用了创新的SailorFog-QA数据集,通过子图采样和信息模糊化技术模拟真实网络环境中的复杂知识图谱。这种方法赋予了模型处理”超人类”任务的能力,在BrowseComp测试中,WebSailor-32B和72B版本不仅领先所有开源模型,还超越了部分闭源系统。

阿里开源WebAgent项目WebShaper GAIA评测超越Claude4-Sonnet插图

WebDancer与WebWalker:构建完整生态

WebAgent的成功离不开两大关键模块WebDancer和WebWalker的支持。WebDancer是一个端到端智能体训练框架,通过四阶段训练(数据构建、轨迹采样、监督微调、强化学习)全面提升AI的多步搜索能力。其最新版本WebDancer-QwQ-32B在GAIA Pass@3评测中取得64.1%的优异成绩。

WebWalker则是一个基准测试工具,用于评估语言模型在复杂网页遍历中的表现,为开发者优化算法提供了标准化的评估体系。WebAgent的混合推理模式通过”思维预算机制”动态分配计算资源,实现快速响应简单查询与深度推理复杂任务的完美平衡。

在实际应用中,WebAgent能在10分钟内完成特斯拉与小鹏汽车配置表的爬取与分析,或从PubMed等数据库提取临床试验数据并生成溯源报告,效率远超人工操作。

开源意义:重塑信息处理与社区创新

WebAgent的开源不仅大幅降低了企业和开发者的使用成本,更为全球AI社区提供了工业级训练框架和评估标准。其GitHub仓库(https://github.com/Alibaba-NLP/WebAgent)已获超4000次星标,位列GitHub trending第一,Huggingface月度第三。WebSailor的训练策略——高难度任务合成、小规模冷启动、高效强化学习优化——为开源社区攻克复杂推理任务提供了宝贵思路。

从学术研究到商业决策,WebAgent的应用潜力无限。研究人员可利用其快速检索ACL2025论文主题,商业用户可分析2025年AI芯片市场趋势,普通用户则能获取旅游规划或健康咨询等个性化建议。WebAgent的开源标志着AI智能体从技术演示迈向生产力场景,未来有望推动跨模态信息整合和开放领域推理的进一步突破。

GitHub:https://github.com/Alibaba-NLP/WebAgent
huggingface:https://huggingface.co/datasets/Alibaba-NLP/WebShaper
model scope:https://modelscope.cn/datasets/iic/WebShaper

最新快讯

2026年01月13日

23:32
2026年1月13日,多位用户反馈在升级至macOS 26后,调整窗口大小功能出现响应问题。尽管窗口视觉上为圆角设计,但系统仍沿用方形窗口的19*19像素触发区域逻辑,导致75%的触发区落在窗口外部。开发者指出,用户习惯点击的绿色区域实际无法触发操作,仅红色区域有效。此设计不一致造成操作困扰,苹果尚未发布修复补丁。
23:32
2026年1月13日,谷歌股价上涨超2%,总市值达4.09万亿美元,续创历史新高。此次增长得益于其Gemini人工智能模型将为苹果Siri等AI功能提供技术支持的消息推动。该合作标志着两大科技巨头在人工智能领域深化协作,进一步拓展AI在智能设备中的应用。市场分析认为,技术整合将增强双方竞争力,推动股价持续走强。
23:32
2026年1月13日,河南金星啤酒股份有限公司正式向港交所递交上市申请。联席保荐人为中信证券与中银国际。此举标志着该公司推进资本市场布局的重要一步。上市募集资金将用于产能提升、市场拓展及品牌建设。金星啤酒成立于1982年,总部位于河南,是中国较早的民营啤酒企业之一。此次赴港上市,意在增强全国竞争力并寻求更广阔发展空间。
23:32
2026年1月13日,死了么APP宣布将在新版本中启用全球化品牌名Demumu。该决策由团队审慎讨论后作出,旨在推动品牌国际化进程。此次更名不涉及公司主体及运营模式变更,原有功能与服务保持不变。用户在更新应用后将逐步看到新品牌标识的呈现。此举被视为其拓展海外市场的重要一步。
23:32
2026年1月13日,中国航天事业再传捷报,太原卫星发射中心成功见证了一幕壮丽的太空之舞。当日,长征六号改运载火箭以雷霆万钧之势升空,精准将遥感五十号01星顺利送入预定轨道。此次发射任务不仅圆满成功,更标志着中国航天在2026年的发射征程中实现了开门红,为全年航天事业奠定了坚实基础。 长征六号改运载火箭作为中国航天领域的重要力量,此次表现再次彰显了其卓越的运...
23:32
2026年1月13日,微软正式在GitHub平台上发布了备受期待的XAML Studio 1.1版本源代码,并采用业界通用的MIT开源许可证。这款强大的开发工具基于成熟的C#语言开发,其核心使命在于赋能开发者高效创建XAML UI原型,并实现界面变化的实时可视化预览。该应用严格遵循UWP(Universal Windows Platform)架构设计,确保在...
23:32
2026年1月13日,Apple大中华区董事总经理葛越正式官宣,备受创作者期待的创新服务——Apple Creator Studio将于1月28日登陆App Store。这一全新平台将重新定义移动创作体验,通过整合行业顶尖的专业创作工具与前沿AI技术,为用户带来前所未有的创作自由。 Apple Creator Studio将首次将Final Cut Pro、...
23:32
三星在上月正式启动了Galaxy S26+与Galaxy S26 Ultra的量产计划。根据最新消息,Galaxy S26+的屏幕尺寸维持在6.66英寸,与上一代产品保持一致。值得注意的是,原本计划推出的Galaxy S26 Edge项目已于去年10月中旬意外叫停,这一变动给Galaxy S26+的开发周期带来了巨大压力。为了应对紧迫的进度,三星最终决定采用...
23:32
2026年1月13日,漫威官方发布《复仇者联盟5:毁灭之日》第四支预告,宣布神奇四侠与瓦坎达势力正式回归。预告显示,此前在《神奇四侠:初露锋芒》中登场的石头人及海王纳摩均现身,暗示多元宇宙联动开启。小罗伯特·唐尼将以毁灭博士身份重磅回归,克里斯·埃文斯、克里斯·海姆斯沃斯等原班人马亦将出演。影片由罗素兄弟执导,定档2026年12月18日北美上映。
22:31
2026年1月13日,由中国铁建大桥局承建的世界最大跨度三塔钢箱梁斜拉桥——青龙门特大桥中主塔成功封顶。该桥位于宁波舟山港六横公路大桥二期工程,主桥长2212米,双主跨达756米,三座主塔高249米。项目采用国内首创的型钢混凝土组合索塔技术,实现海上“搭积木式”装配化施工,并配备浙江省内最强起重塔吊系统,确保毫米级安装精度。大桥建成后,将结束六横、佛渡不通...
22:04
微新创想1月13日重磅报道,知名汽车博主韩路今日公开了与科技企业家王自如的深度访谈内容,其中王自如就近期引发热议的“工资条事件”作出了详细回应。这一事件源于他曾在与格力电器董事长董明珠共同参与的电视节目中,透露自己从未查阅过格力提供的工资条,并强调当时唯一的要求是希望办公室能靠近董明珠,以便随时汇报工作。这一言论播出后,迅速在公众中引发了广泛争议。 在此次采...
22:04
微新创想1月13日讯 随着春节的脚步日益临近,中国传统马年即将到来。在这辞旧迎新的时刻,支付宝App迎来了一次重要的版本更新,版本号为10.8.26。此次更新不仅对多项细节进行了优化,显著提升了App的整体流畅度,更在图标上新增了令人熟悉的"集福啦"字样,这无疑预示着一年一度的支付宝集五福活动即将拉开帷幕。 在苹果App Store的最新页面显示,今年的集五...