英国金融 AI 大测试

10次阅读
没有评论

共计 1431 个字符,预计需要花费 4 分钟才能阅读完成。

AI 理财建议过半出错,复杂问题接近九成翻车

最近一则海外测试结果在财经短视频圈广为传播:英国机构测试多款 AI 大模型,用于金融咨询场景,整体出错率极高。很多视频直接表述为“英国金融监管机构测试 AI”,但背后真实事件,有不少容易被忽略的细节。

这项测试由英国金融科技公司 Saturn 完成,报告名称为《Artificial Authority: Should you trust AI to deliver financial advice?》(人工权威:你能相信 AI 给出理财建议吗?),2026 年 9 月对外发布。重点:测试主体是一家金融科技企业,并非英国金融行为监管局 FCA,不属于官方监管实验。

测试如何开展

测试一共选取 18 款主流大模型,包含 ChatGPT、Claude、Gemini、Copilot、Grok 等,覆盖免费版与付费版本。

题库由 121 道英国个人真实金融问题组成,每道题目重复提问 5 轮,累计完成上万次问答。题目贴近普通人生活,涉及养老金、税务、个人理财等现实问题。

核心测试结果

1. 全部试题平均错误率 57%,也就是说,AI 回答每两道金融问题,大约就有一道存在问题。

2. 需要多步逻辑推导、复杂计算的难题,平均错误率达到 88%,部分模型在最难题目上错误率高达 99%。

3. 分层对比:免费大模型平均错误率 63%;付费大模型表现更好,但依旧有 49% 的错误率。

4. 全场表现最佳的 Claude Opus5 推理模式,仍然存在 39% 的错误。

判定标准比较严格:只要答案出现事实错误、关键信息缺失、缺少必要风险提示,都会直接判定为回答错误,并非只看计算结果对错。

AI 常见的几类错误

– 基础算术运算出错;

– 产生幻觉,编造不存在的英国金融、税务法规;

– 忽略即将生效的税法调整,遗漏重要前提;

– 养老金相关税务解释出错。报告举例,其中一条 AI 给出的错误方案,会让用户面临 17500 英镑的税务罚款。

事件背后的争议点

1. 测试方带有商业诉求

Saturn 本身是金融科技公司,本次研究的目的之一,是推动英国 FCA 完善 AI 理财相关监管规则,并非中立学术研究,存在立场倾向。

2. 媒体传播存在简化失真

《金融时报》报道之后,该数据迅速走红。大量短视频直接简化为“英国监管测试 AI,过半答案出错”,把企业测试当成官方监管结论,放大了冲击力。

3. 场景局限

本次测试题目基于英国本土财税、养老金制度,这套结论不能直接套用到国内金融场景。

启示

AI 可以作为金融信息检索、初步梳理的辅助工具,但绝对不能直接采纳 AI 给出的理财、税务实操建议。尤其是涉及复杂税务、养老金规划、资产配置这类高风险决策,AI 极易出现幻觉、计算失误。任何关系到资金、税务的重要决定,必须由持牌专业人员复核。

需要注意,本次测试由金融科技企业 Saturn 发起,该公司业务面向理财机构提供合规工具,推动 AI 金融监管对其自身业务有利,存在天然立场。

报告里 AI 输出错误答案的案例属实,但统计判定标准偏严格:只要遗漏风险提示、缺少前置条件,即判定为错误,并非只有完全答错题才算失败;同时题库刻意选取大量英国复杂税务、养老金难题,属于“难题富集”测试集。这两点都会推高整体错误率。报告还重点引用大额罚金的极端案例进行传播渲染,客观上放大了普通人日常使用 AI 咨询金融问题的风险预期。

所以结论需要辩证看待:通用大模型在复杂个人财务场景确实不可轻信,不能直接拿来落地理财决策;但 57% 的高错误率,不能简单理解为普通人随便问一句金融问题,AI 就大概率给出会造成巨额损失的错误方案。

正文完
 0