AI统计查询准确率仅两成,联合国联手Google重建数据底座
联合国与Google合作推出UN System Data Commons,以自然语言和MCP协议替代旧门户,应对大模型统计问答准确率仅21.2%的可靠性危机,已有26个机构承诺接入。
旧门户退场,自然语言查询成新入口
联合国庞大的全球统计体系正在经历一次底层交互方式的切换。一项与Google达成的合作计划,将把分散在各机构的数据资源整合进名为“联合国系统数据共享平台(UN System Data Commons)”的新系统,用以取代现有的UNData门户。
新平台的技术底座来自Google开源的Data Commons。用户不再需要在传统数据库界面中逐层筛选,而是可以直接用日常提问的方式检索全球发展、人口、教育、健康、经济等领域的官方统计信息。这一变化的核心指向很明确:让数据不仅对人友好,也对机器友好。
更值得关注的是,该平台支持模型上下文协议(MCP)。这一标准允许人工智能模型直接连接外部数据源,使AI智能体在执行分析、研究与查询任务时,能够直接调用联合国官方统计数据,而非依赖未经核实的网络信息。
大模型统计问答暴露可靠性短板
联合国推动这一项目的直接动因,来自一项令人不安的测试结果。联合国儿童基金会近期对多款主流大语言模型进行了评估,覆盖超过13.3万个回答样本。
参与测试的模型包括GPT-4o、GPT-4o-mini、Claude Sonnet 4.5、Claude Haiku 4.5、Gemini 2.5 Flash以及Gemini 2.0 Flash。六款模型的平均准确率仅为21.2%,大约六成回答甚至未能给出可用数字。
- 不少模型倾向于用模糊措辞回避具体数值;
- 即使给出数字,同一问题在不同时间重复提问,答案也经常发生变化;
- 研究团队认为,这反映出AI系统在调用全球发展数据时仍面临严重的可靠性挑战。
与此同时,用户行为正在快速迁移。联合国儿童基金会观察到,今年以来通过ChatGPT等AI工具跳转至其数据网站的访问量同比增长67%,来自人工智能助手的访问已占该网站总流量的大约十分之一。对于一个每月访问量超过600万人次的数据平台而言,这一比例意味着信息获取方式的结构性转变。
26个机构承诺接入,数据基础设施争夺战升温
面对上述趋势,联合国的判断是:仅仅发布数据已经不够。若希望未来的人工智能系统准确引用权威统计,就必须主动让数据具备机器可读、AI可访问和智能体可调用的能力。
目前已有26个联合国机构承诺加入新平台,其中接近20个机构的数据在系统上线时已开放使用。随着更多机构接入,平台预计将汇集覆盖经济、社会、环境、教育、健康和可持续发展等多个领域的大规模官方统计资源。
联合国表示,这项计划旨在为研究人员、政策制定者、企业以及普通公众提供更可靠的数据基础,同时确保越来越多依赖AI完成分析和决策的系统,能够建立在权威事实之上,而非不稳定或错误的信息来源。
国际组织首次为AI智能体搭建官方数据通道
从行业视角看,此次合作的意义超出了单一平台的替换。它标志着国际组织首次系统性地为“AI智能体时代”建设官方数据基础设施。
当AI逐渐成为人们获取知识和查询信息的主要入口,权威数据源若不能以机器可读的方式接入模型生态,就可能在信息传播链条中被边缘化。联合国与Google的这次尝试,本质上是在争夺AI时代事实供给的定义权——让智能体在回答全球发展问题时,有官方数据可查、有可靠协议可依。
这一模式若被其他国际组织或政府统计机构效仿,全球公共数据的开放与调用方式或将迎来一轮系统性重构。