微新创想(idea2003.com) 7月31日讯:一项最新研究揭示了大型语言模型在不同语言处理上的成本差异,这一发现对于全球范围内的AI应用具有重要启示。研究指出,以OpenAI为代表的服务在处理英语输入和输出时成本最低,而其他语言则呈现出显著差异。具体而言,简体中文的处理成本约为英语的两倍,西班牙语则需1.5倍,而掸语更是高达15倍。

牛津大学的研究团队通过实验发现,一个大型语言模型处理一句缅甸语句子需要198个tokens,相比之下,同样的英语句子仅需17个tokens。Token作为衡量API访问大型语言模型(如OpenAI的ChatGPT或Anthropic的Claude 2)计算成本的基本单位,这一数据直观地表明,处理缅甸语句子的成本是英语的11倍。这种「标记化」模型的工作方式意味着,非英语语言在访问和训练时往往面临更高的经济门槛。

语言结构差异是造成成本差异的核心原因。以中文为例,其语法结构和字符数量与英语存在本质区别,导致标记化成本显著提高。OpenAI的GPT3 tokenizer数据显示,「your affection」这一词组在英语中仅需两个tokens,而在简体中文中却需要八个tokens。尽管英语文本有14个字符,但简体中文仅用4个字符就能表达相同含义,这种差异直接影响了计算资源的消耗。

微软在其ChatGPT模型API使用页面上提供了实用的标记化工具,帮助用户测试不同提示的成本。该工具显示,英语中1个token约等于4个字符,100个tokens则相当于75个英文单词。值得注意的是,这种线性关系并不适用于其他语言,微软对此有明确说明。

从成本效益角度来看,英语在人工智能领域展现出无与伦比的优势。以中文为例,其使用成本是英语的两倍。这一现象反映了当前AI公司训练模型时可用数据的分布情况。高质量紧急数据(如生活记录产生的数据)的价值在人工智能爆发期得到充分体现,这也直接关系到AI公司实现递归训练的愿景——即用自身输出训练AI模型。

若要实现这一目标,未来模型仍将延续英语的成本优势。其他语言由于复杂性和基础训练数据的局限性,标记化速率将持续偏高。进一步分析表明,除了标记化之外,其他成本衡量方法(如位数或字符计数)同样无法绕开这一困境。英语凭借其较高的「可压缩性」,在标记数量上始终处于领先地位,这并非货币化方式的问题,而是技术和基础模型训练中的真实局限。

值得注意的是,这一成本差异不仅存在于当前的大型语言模型,未来多语言模型也可能面临相同挑战。毕竟,这些模型大多采用相似的技术架构。考虑到ChatGPT等大型语言模型及Midjourney等生成式图像网络主要诞生于美国,成本差异已促使中国和印度等国家启动本土语言模型的研发计划。这些国家声称此举旨在配合以英语为基础的AI网络实现创新速度,而创新速度本身正受限于访问和训练成本。

在人工智能这一复杂而深远的领域,成本效益始终是关键考量因素。每个决策都需要谨慎权衡,因为微小的变化可能产生巨大的影响。语言处理成本问题不仅关乎经济效率,更反映了全球AI发展的不平衡现状。随着技术的不断进步,如何平衡成本与质量,将成为未来AI领域的重要课题。

最新快讯

2026年02月10日

06:47
微新创想:2025年全国社会物流总额达到368.2万亿元同比增长5.1%这一数据由中国物流与采购联合会于2026年2月10日正式发布 该增速在全年各季度中保持稳定表现相较于“十四五”期间年均增速5.7%略有下降但仍高于同期GDP增速显示出物流行业持续增长的态势 物流总费用与GDP比率降至历史最低水平这一变化反映出物流效率的持续提升以及产业结构的不断优化表明我...
05:46
微新创想:2026年2月10日,Meta首席执行官扎克伯格宣布公司全新人工智能模型将于今年正式亮相并投入应用。这一消息引发了广泛关注,标志着Meta在人工智能领域迈出了重要一步。 该人工智能模型的核心目标是显著提升多模态理解、推理与生成能力。通过整合文本、图像、音频等多种数据形式,新模型将实现更全面的智能交互体验。这一突破有望为多个行业带来深远影响,尤其是在...
05:46
微新创想:2026年2月10日,美国半导体企业安森美公布2025年第四季度财报。数据显示,公司当季营收达到15.3亿美元,与市场分析师平均预期基本吻合。根据财报指引,安森美预计2026年第一季度的营收将在14.4亿至15.4亿美元之间,区间中值为14.9亿美元。这一预测略低于分析师预期的15.1亿美元。值得注意的是,此次财报并未披露具体的盈利数据以及各地区的...
04:45
微新创想:2026年2月10日,OpenAI在美国向部分免费版及ChatGPT Go订阅用户启动广告功能测试。这一举措标志着OpenAI在探索可持续商业化模式方面迈出了重要一步。 此次广告功能的测试将广告内容展示在聊天界面的底部,并通过‘赞助’标签进行标注,以确保用户能够清晰识别广告信息。这种透明化的处理方式有助于维护用户体验,同时为广告主提供明确的展示位置...
03:14
微新创想:2026年2月10日,耐克旗下匡威品牌宣布启动战略重组,要求全体员工本周起居家办公。此次调整覆盖美国马萨诸塞州贝弗利总部及全球办公点,标志着匡威在品牌发展道路上迈出重要一步。 此次战略重组涉及岗位优化与团队重构,旨在重振销售增长。匡威管理层表示,这一举措是为了更好地适应市场变化,提升运营效率,并为品牌未来的发展奠定坚实基础。 据内部消息透露,重组过...
02:12
微新创想:2月10日,美国股市加密矿企概念板块持续走高。TeraWulf与Cipher Mining股价涨幅均超13%,Applied Digital涨逾9%,IREN涨超7%。此次上涨发生于纽约证券交易所交易时段,主要受比特币价格回升及市场对算力需求预期增强推动。多家机构指出,减半周期临近叠加能源成本优化,正提振行业盈利预期。
02:12
微新创想:2026年2月10日,国际评级机构惠誉宣布确认德国西门子股份公司长期外币发行人违约评级为“A+”,评级展望维持“稳定”。此次确认基于西门子稳健的现金流生成能力、多元化的业务结构及在工业自动化与能源领域的领先地位。 微新创想:惠誉指出,尽管面临宏观经济波动与转型投资压力,西门子依然保持了良好的财务状况。公司财务杠杆处于可控范围内,EBITDA利息覆盖...
02:12
微新创想:2026年2月10日,Alphabet Inc.宣布计划发行约150亿美元的美元债券,该债券已获得超过1000亿美元的认购意向。这一发行规模和认购热情在当前市场环境下显得尤为突出,显示出投资者对人工智能领域优质企业债券的高度关注和信心。 此次债券发行吸引了多家国际知名投行参与承销,显示出市场对其的认可。同时,Alphabet还授权安排了瑞郎及英镑债...
02:12
微新创想:2026年2月9日(当地时间),美国AI数据平台Databricks宣布完成50亿美元股权融资,并获20亿美元新增债务融资额度。本轮融资后公司估值升至1340亿美元,较2025年夏季上一轮估值增长34%。 Databricks总部位于旧金山,由前加州大学伯克利分校教授于2013年创立。公司专注于构建统一的数据与AI分析平台,致力于帮助企业更高效地处...
00:42
微新创想:2026年2月10日,润滑油与燃油特种化学品公司润英联正式发布新型SAE 0W-20添加剂产品P6188。该产品专为满足大众最新VW 50800/50900规范设计,可助力成品油通过认证。 P6188适用于高性能汽油发动机,提升燃油经济性与长效保护性能。这一创新添加剂不仅能够优化发动机运行效率,还能有效减少磨损,延长发动机使用寿命。 润英联表示,该...
00:42
微新创想:2026年2月10日,亿纬锂能与合作伙伴正式签署吉隆坡国际机场(KLIA)光伏储能项目合同。该项目位于马来西亚雪兰莪州,标志着亿纬锂能首次进入马来西亚的关键基础设施领域。根据合同内容,亿纬能源将提供628Ah储能电芯及5MWh储能系统,为机场的能源供应提供稳定支持。 微新创想:此次合作不仅体现了亿纬锂能在全球储能市场的布局深化,也展示了其在推动绿色...
00:42
微新创想:2026年2月10日,立邦中国与江苏中电创新科技发展有限公司在江苏南京正式签署战略合作协议。此次签约是双方在涂装材料技术创新及高端工业工程建设领域迈出的重要一步。 双方将共同致力于电子、大健康、新能源等对洁净度、耐腐蚀性及环保性能要求较高的产业设施建设。这些行业对材料的性能和施工标准有着极高的要求,因此合作将围绕这些关键领域展开深入探索。 通过此次...