把同一份20行模拟订单交给ChatGPT、DeepSeek、Kimi、豆包:四份回答的14笔明细金额都对,但首轮总额分别是1480.50、1911.40、1264.70、1287.20。
独立脚本复算:1264.70。每份回答自己的明细加总,也都是这个数。
这次Kimi实际调用了Python;四家网页模式不同,单题单轮不做模型排名。它的数字虽对,说明中仍有一处“120等于240”的错误表述。
输入、原回答JSON与核对过程:网页链接
看AI答案,别漏了独立求和这一步。AI实测ChatGPTDeepSeek
模拟数据;图表为原回答字段转写,AI辅助整理并核验。





