工程边界测试 (共1篇)

11个AI同答SQL题：3个直接0分，Claude与GPT为何崩盘

11个主流模型在“最近90天用户已支付订单总额”SQL任务中分化明显。8个模型得分60，正确使用DATE_SUB或兼容INTERVAL语法；Claude Sonnet 4.6、Claude Opus 4.7、GPT-o3直接0分，因日期区间写法与主流MySQL方言冲突，导致查询无法执行。