企业财务软件公司Saturn发布的一项研究显示,ChatGPT、Claude、Copilot、Grok和Gemini等主流AI模型在回答财务相关问题时,平均有57%的答案存在错误。该研究覆盖逾百个财务问题,测试了上述模型提供的免费及付费版本,每个问题最多重复提问五次,向18种AI模型累计提出超过10,000个问题。
研究发现,AI模型给出的错误答案类型包括计算错误、遗漏即将实施的税收政策变更,以及凭空捏造规则(即幻觉)。研究指出,在税务等对准确性要求较高的场景中,依赖AI回答可能导致严重的经济损失。这一发现对当前企业加速将AI引入财务、税务流程的趋势构成直接警示。
从模型表现差异来看,付费模型的回答准确率高于免费模型,较新版本的模型整体优于较旧版本。即便如此,表现最好的推理模式Claude Opus 5仍有39%的答案存在错误。这意味着即使选用当前能力最强的付费推理模型,财务问题的回答可靠性仍难以满足专业场景的要求。
Saturn并未披露参与测试的18种模型的具体版本清单,但其结论指向一个行业性问题:大模型在需要精确计算和实时政策更新的垂直领域仍存在明显短板。财务与税务规则具有强时效性和高准确性门槛,而当前模型的训练数据存在滞后,且缺乏对计算结果的内置校验机制。
对于正在评估AI财务应用的企业而言,该研究提示,将大模型直接用于税务申报、财务核算等高风险环节仍需谨慎,人工复核环节在短期内难以被替代。同时,这一结果也为面向财务场景的垂直AI工具留出了市场空间,如何通过检索增强生成、规则引擎结合等方式提升答案准确率,将成为企业服务厂商的竞争焦点。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。