科技公司 Saturn 发现,AI模型在回答金融问题时,平均有57%的答案不正确。
对于涉及多项计算的复杂查询,错误率升至88%,这凸显了依赖生成式AI作出税务、养老金和投资决策可能带来的财务后果。
研究称,某一模型在养老金税务问题上的错误,可能导致养老金储户被英国税务海关总署(HMRC)追缴1.75万英镑,约合2.343万美元。
据英国《金融时报》报道,科技公司 Saturn 对ChatGPT、Claude、Copilot、Grok和Gemini的免费版及付费版进行了测试,发现这些模型在回答金融问题时,平均有57%的答案不正确。对于涉及多项计算的复杂查询,错误率升至88%,凸显了依赖生成式AI作出税务、养老金和投资决策可能带来的财务后果。
AI模型难以应对复杂金融问题
研究人员测试了18个模型,涵盖100多个与金钱相关的问题。他们总共提交了逾1万个提示词,每个问题最多重复五次。
研究发现,模型在金融计算中出现错误,未能考虑税法未来变化,虚构规则,并对需要多项计算的复杂问题给出错误回答。
部分模型在复杂问题上的错误率达到99%。Claude Opus 5在“推理”模式下表现最佳,但仍有39%的问题回答错误。
Saturn首席执行官阿马尔·乔利表示,广泛使用AI获取金融指导带来了额外风险。
他说:“数百万人正在信任AI模型提供金钱建议,但他们得到的是可能让他们蒙受金钱损失的错误答案。”
错误可能带来高额成本
在一项测试中,研究人员向免费版Claude Haiku 4.5询问养老金税务问题。研究称,其错误可能导致一名养老金储户被HMRC追缴1.75万英镑,约合2.343万美元。
在另一案例中,Claude“编造了一项规则”,声称一名毕业生移居海外后可以停止偿还学生贷款。
付费模型整体上比免费版本更准确,较新的模型也给出了更好的结果。投资平台AJ Bell个人理财主管莎拉·科尔斯表示,AI仍可帮助用户进行预算管理和查找信息。
她说:“这很好地说明了,真正需要支持的人应该获得适当建议,而不是信任AI。”
这些发现与英国金融行为监管局最近的一项研究一致。该研究发现,五分之一的英国成年人愿意让AI代表他们作出金融决策。人们对债务、养老金和投资等复杂领域的兴趣最强。
乔利表示,AI金融建议目前未受监管,用户因此无法获得咨询人类专业人士时所享有的同等保护和赔偿。
OpenAI最近推出了面向金融行业的ChatGPT。
来源:HODL Press
