如何为强大的AI模型建立一套真正公正的评估标准?尽管世界顶级AI ChatGPT能够通过各类考试,甚至生成令人真假难辨的回答,但它仍存在明显短板——难以解决简单的视觉逻辑问题。在一项测试中,屏幕上排列着色彩斑斓的方块图案,多数人能轻松找出连接规律,然而根据今年5月的研究报告,GPT-4在这类图案测试中的正确率仅为1/3,另一类图案的正确率更是低至3%。这项研究旨在为AI能力评估提供更科学的基准,帮助攻克GPT-4等大型语言模型的局限。论文作者Melanie Mitchell指出,当前AI领域正面临如何有效评估系统的难题。

AI评估的困境与突破
过去两三年间,大型语言模型(LLM)在多项任务上已超越传统AI系统。其核心原理是通过数十亿在线句子的统计相关性,在输入时预测最可能的下一个单词。对于聊天机器人,人类训练员的反馈进一步优化了其反应机制。这种基于海量人类语言数据训练的算法,展现出令人惊叹的广度。尽管其他AI系统可能在特定任务上表现优异,但它们必须针对特定问题进行训练,无法实现跨任务迁移。哈佛认知科学家Tomer Ullman指出,学界对LLM能力的解释存在两种截然观点:一部分人认为其成就源于推理或理解的突破,而包括Mitchell在内的研究者则持谨慎态度。

基准测试的价值与局限
揭示人类与AI能力差异的逻辑谜题测试,正成为评估AI的重要方向。纽约大学认知计算科学家Brenden Lake强调,这类基准测试能暴露机器学习系统的不足,并阐明人类智能的关键要素。如何测试LLM以及这些测试的意义,都是极具实践价值的研究课题。Mitchell特别指出,若要将LLM应用于医学、法律等领域,了解其能力边界至关重要。

图灵测试的争议与演进
长期以来,图灵测试被视为机器智能的权威评估标准。1950年,艾伦·图灵提出的”模仿游戏”设想中,人类法官需在计算机与真人对话中识别出机器。这一测试本质上是判断”机器能否思考”的哲学命题。然而图灵并未明确测试细节,导致标准模糊。AI21实验室的在线游戏显示,超过150万玩家仅能正确识别60%的机器人对话,熟悉LLM的研究人员表现更佳。谷歌软件工程师François Chollet建议,应让LLM面对训练数据中的变体场景,而非单纯测试其记忆能力。

基准测试的挑战与反思
当前AI评估更倾向于使用针对特定能力(语言、常识推理等)的基准测试,包括人类设计的学术考试。GPT-4在OpenAI设计的阅读理解、数学等测试中表现优异,并在30项人类考试中取得佳绩。但研究人员指出,模型可能已见过类似问题,导致测试结果存在”污染”问题。更深层的问题在于,LLM通过语言学习的方式与人类截然不同,无法像人那样在物理世界中体验语言与世界的联系。OpenAI研究员Nick Ryder强调,LLM测试分数不能等同于人类能力,其评估目的仅在于衡量模型在特定任务的表现。

逻辑谜题测试的兴起
2019年,Chollet创建的抽象和推理语料库(ARC)成为LLM测试的重要工具。该测试要求解题者根据方格图案变化规律预测下一个图形。尽管多个研究团队使用ARC测试LLM,但无一能接近人类表现。Mitchell团队在此基础上开发了ConceptARC,在难度和概念聚焦上进行了优化。该测试将GPT-4与400名人类参与者对比,人类平均正确率达91%,而GPT-4在各类测试中的得分均低于30%。

AI推理能力的真相
尽管GPT-4在ConceptARC中表现不佳,但研究显示它仍能解决部分未训练过的问题。Bowman指出,该测试存在视觉输入劣势——GPT-4接收数字数组表示的图像,而人类直接观察图像。综合其他实验结果,LLM已具备基本抽象推理能力,但能力水平参差不齐且远逊于人类。随着模型参数规模扩大,推理能力有望提升。如何全面评估LLM的抽象推理能力,仍是AI领域亟待解决的难题。

最新快讯

2026年02月10日

23:12
微新创想:2026年2月10日,深圳第零智能科技股份有限公司正式向香港交易所递交上市申请。公司注册地及运营主体位于广东深圳,拟通过首次公开发行股票募集发展资金。本次IPO由民银资本独家保荐。 递表标志着该公司迈出港股上市关键一步,旨在拓展资本市场融资渠道,支持其在智能硬件与AI终端领域的研发及商业化进程。作为一家专注于智能硬件与AI终端技术的企业,第零智能近...
23:12
微新创想:2026年2月10日,摩根大通策略师Dubravko Lakos-Bujas团队指出,市场对AI短期颠覆软件行业的担忧不切实际,软件股正迎来反弹契机 该行认为,近期无差别抛售已导致板块估值处于历史低位,叠加持仓出清、悲观情绪过度及基本面稳健,风险平衡转向上行 建议投资者增配高质量、抗AI颠覆能力强的软件股 此次调整源于市场担忧AI工具冲击传统Saa...
23:12
微新创想:2026年2月10日,谷歌在美国正式推出升级版隐私搜索结果管理功能。这一更新旨在进一步增强用户对个人隐私的控制能力,让用户能够更方便地管理网络上的个人信息。 用户可以通过“关于你的搜索结果”页面,提交驾照、护照号、社安号(SSN)等敏感信息。系统会自动扫描互联网,查找包含这些信息的网页链接,并通知用户。用户可以申请移除对应的搜索结果,从而减少个人信...
22:38
微新创想:2026年2月10日,AOC爱攻正式发布24G4ZR与27G4ZR两款电竞显示器。这两款显示器分别采用了23.8英寸和27英寸的Fast IPS面板,为玩家带来更宽广的视野和更清晰的画质。它们的原生刷新率达到了240Hz,同时支持超频至260Hz,确保在高速游戏场景中流畅无拖影。 两款显示器的分辨率均为1920×1080,满足大多数玩家的日常使用和...
22:38
微新创想:2月6日,全国首单数字人民币智能合约在四川成都建筑行业工资发放场景成功应用。此次应用标志着数字人民币在实际场景中的深度落地,为农民工工资支付提供了全新的解决方案。 由中国人民银行数字货币研究所、四川省住房和城乡建设厅以及成都高新区管委会共同见证,一智科技与交通银行四川分行等机构携手推进,实现了对104名工人的精准薪酬发放,总金额超过100万元。所有...
22:08
微新创想:2025年春运期间,全国铁路运输迎来高峰。自2月2日春运正式启动至2月10日,全国铁路累计发送旅客已突破1亿人次。随着春节临近,返乡客流持续攀升,铁路部门不断加大运力投入以满足出行需求。 2月10日作为北方小年,预计全国铁路将发送旅客1395万人次。为应对客流高峰,铁路部门当天加开列车1363列,全力保障旅客出行。相比前一日,2月9日的发送量为14...
22:08
微新创想:2026年2月10日,苹果公司针对英国竞争与市场管理局(CMA)的反垄断调查,正式宣布了四项承诺。这些承诺旨在回应监管机构对其在应用分发和系统内自我优待行为的质疑,涵盖多个关键领域。首先,苹果承诺确保App Store的审核与排名机制更加公平透明,杜绝任何形式的偏袒。其次,公司将严格保护第三方开发者的数据安全,防止未经授权的数据访问或滥用。此外,苹...
22:08
微新创想:2026年2月10日,挪威国家石油公司宣布,计划在2030年前将国际石油产量提升至90万桶油当量/日。这一战略举措旨在优化全球资产组合,进一步强化公司在海外市场的业务布局。公司表示,此次增产计划将有助于提升其在全球能源市场中的竞争力。 微新创想:尽管公司未公布具体的投资金额以及重点增产区域,但明确指出该计划将兼顾低碳转型的目标。这意味着在扩大石油产...
22:08
微新创想:2026年2月10日,伦敦证券交易所集团(LSEG)宣布与法国安盛投资管理公司(AXA Investment Managers)建立私募基金基础设施合作伙伴关系 双方将在欧洲及全球范围内合作开发标准化、数字化的私募基金数据报告与合规服务平台 该平台旨在提升私募基金在估值、披露和监管报送方面的效率与透明度 合作不涉及股权交易 将依托LSEG的Data...
22:08
微新创想:2026年2月10日,裕同科技(002831.SZ)发布公告,宣布拟以4.49亿元人民币收购华研科技51%的股份。此次交易的对手为观点投资,该公司由裕同科技实际控制人王华君与吴兰兰夫妇全资控股,因此该交易被认定为关联交易。资金来源为公司自有资金或自筹资金,交易完成后,华研科技将成为裕同科技的控股子公司,并纳入公司的合并报表范围。 华研科技自2016...
22:08
2026年2月10日,国家医保局发布2026年度第一批“高效办成一件事”重点事项清单。明确要求2026年底前,全国所有省份开通职工医保个人账户跨省共济功能。同时,目标包括:80%定点医疗机构实现医保费用即时结算;至少开展一批次国家组织药品和高值医用耗材集采;基本实现住院分娩生育医疗费用省内跨统筹区直接结算。此举旨在提升医保服务便捷性与公平性,强化个人账户资...
22:08
微新创想:2026年2月10日,蒙古国进口炼焦煤市场震荡偏弱。受春节假期临近影响,下游焦钢企业补库基本结束,采购情绪低迷,询盘问价偏低,现货市场成交氛围冷清。 口岸贸易商报价暂稳,但期货盘面下跌。市场整体表现较为疲软,缺乏明显的上涨动力。部分企业因节前备货需求已基本完成,导致短期内对炼焦煤的需求有所下降。 值得注意的是,蒙古国线上电子竞拍参与积极性提升,当日...