AI 财务问答:平均 57% 的回答是错的
Saturn 的一项研究用逾 10,000 个财务问题测试 18 种 AI 模型,平均 57% 的回答存在错误,表现最好的模型仍有 39% 出错。
把报税、预算或投资问题丢给聊天机器人,麻烦往往不是它拒绝回答,而是它答得足够像那么回事。Saturn 的一项研究测了 18 种 AI 模型,向它们提出逾 10,000 个财务问题,平均 57% 的回答存在错误。
测试怎么做的
研究使用了一百多个财务问题,覆盖 ChatGPT、Gemini、Claude 和 Copilot 的免费版与付费版;Grok 与这些模型同属被点名的主流系统。每个问题最多向同一模型重复提问五次,目的是看答案是否稳定——同一个问题问两遍就给出不同说法的模型,比稳定犯同一个错的模型更难用。18 种模型加起来,问题总数超过一万个。
财务问题本身就是一道严苛的考题。多数领域里,一个听起来合理的错误答案只是让人多绕一段路;在税务和个人财务里,答案通常能对照公开规则验证,而规则往往带生效日期。有标准答案,而且标准答案会变。
错在哪里
研究把错误归成三类:计算错误、遗漏即将实施的税收政策变更、凭空捏造规则(幻觉)。第一类只要自己重算一遍就能发现。第二类是数据时效问题:税法按时间表更新,用较旧语料训练的模型可能把去年的门槛说成今年的。第三类对普通用户最危险,因为编造出来的抵扣项或申报要求,语气和真实规则一模一样。研究提到,在最严重的情况下,照着 AI 的税务回答行事可能造成严重经济损失。
付费和更新的模型更好,但不够好
两个规律成立:付费模型比免费模型准确,较新的模型优于较旧的模型。最好成绩来自推理模式的 Claude Opus 5,仍有 39% 的回答出错——相当于每五个问题错两个。
这个排名有用,但谈不上让人放心。它说明不同档次的模型之间确有差距,差距又不足以改变结论:从免费版换到付费版,错误会少一些;但没有任何一个模型可以接过来一份税表,让人放心地照着填。
用 AI 处理钱的问题,可以怎么用
更实际的建议不在选哪个模型,而在把任务拆开。聊天机器人擅长的是语言层面的活:解释一个术语、把模糊的担忧变成具体问题、起草一张给会计师的清单、总结你手里已有的文件。它不擅长的,是需要“最新”和“准确”的环节,尤其是税率、资格条件和截止日期。
一个低成本的习惯是让它给出处,然后自己去看那份出处;说不出出处的答案,还不算事实。另一个习惯是任何数字都先当草稿,核对过原始文件再采用。57% 的平均错误率不是一个靠下一代模型就能抹平的数字,而 39% 的最好成绩,也不该出现在一份要签字提交的税务申报里。
来源:AI 聊天机器人经常给出错误的财务问题答案(Solidot)