研究测算AI金融建议出错频率

阅读约 8 分钟 Tags:

科技公司 Saturn 发现,AI模型在回答金融问题时,平均有57%的答案不正确。

对于涉及多项计算的复杂查询,错误率升至88%,这凸显了依赖生成式AI作出税务、养老金和投资决策可能带来的财务后果。

研究称,某一模型在养老金税务问题上的错误,可能导致养老金储户被英国税务海关总署(HMRC)追缴1.75万英镑,约合2.343万美元。

英国《金融时报》报道,科技公司 Saturn 对ChatGPT、Claude、Copilot、Grok和Gemini的免费版及付费版进行了测试,发现这些模型在回答金融问题时,平均有57%的答案不正确。对于涉及多项计算的复杂查询,错误率升至88%,凸显了依赖生成式AI作出税务、养老金和投资决策可能带来的财务后果。

AI模型难以应对复杂金融问题

研究人员测试了18个模型,涵盖100多个与金钱相关的问题。他们总共提交了逾1万个提示词,每个问题最多重复五次。

研究发现,模型在金融计算中出现错误,未能考虑税法未来变化,虚构规则,并对需要多项计算的复杂问题给出错误回答。

部分模型在复杂问题上的错误率达到99%。Claude Opus 5在“推理”模式下表现最佳,但仍有39%的问题回答错误。

Saturn首席执行官阿马尔·乔利表示,广泛使用AI获取金融指导带来了额外风险。

他说:“数百万人正在信任AI模型提供金钱建议,但他们得到的是可能让他们蒙受金钱损失的错误答案。”

错误可能带来高额成本

在一项测试中,研究人员向免费版Claude Haiku 4.5询问养老金税务问题。研究称,其错误可能导致一名养老金储户被HMRC追缴1.75万英镑,约合2.343万美元。

在另一案例中,Claude“编造了一项规则”,声称一名毕业生移居海外后可以停止偿还学生贷款。

付费模型整体上比免费版本更准确,较新的模型也给出了更好的结果。投资平台AJ Bell个人理财主管莎拉·科尔斯表示,AI仍可帮助用户进行预算管理和查找信息。

她说:“这很好地说明了,真正需要支持的人应该获得适当建议,而不是信任AI。”

这些发现与英国金融行为监管局最近的一项研究一致。该研究发现,五分之一的英国成年人愿意让AI代表他们作出金融决策。人们对债务、养老金和投资等复杂领域的兴趣最强。

乔利表示,AI金融建议目前未受监管,用户因此无法获得咨询人类专业人士时所享有的同等保护和赔偿。

OpenAI最近推出了面向金融行业的ChatGPT。

来源:HODL Press

TAGGED:
全球首位AI女演员直播时失灵

AI数字角色蒂莉·诺伍德2026年9月18日采访中一度从英语…

阅读约 8 分钟
凯文·奥莱利成比特币迈向100万美元最大威胁

凯文·奥利里称,若消除量子计算威胁比特币密码学的担忧,其价格…

阅读约 9 分钟
纽交所测试 Avalanche 一年,股市上链

Ava Labs总裁库珀称,纽交所过去一年测试Avalanc…

阅读约 9 分钟
AI催生新一代独角兽初创企业

安德森·霍洛维茨援引硅谷银行数据称,2026年新晋独角兽年龄…

阅读约 8 分钟
Gemini AI模型走出测试,攻击3家真实公司

据《华尔街日报》报道,Gemini测试中进入三家真实公司系统…

阅读约 10 分钟