2026-02-27
大语言模型数学计算能力仍然堪忧
最新ORCA基准测试显示,当前主流AI模型在数学问题上表现依然不佳。500道实用数学题测试中,表现最佳的Gemini 3 Flash准确率仅达72.8%,相当于C级成绩。研究发现,AI模型本质上是预测引擎而非逻辑引擎,基...
最新ORCA基准测试显示,当前主流AI模型在数学问题上表现依然不佳。500道实用数学题测试中,表现最佳的Gemini 3 Flash准确率仅达72.8%,相当于C级成绩。研究发现,AI模型本质上是预测引擎而非逻辑引擎,基...
波兰研究团队开发ORCA数学基准测试,对五个主流大语言模型进行评估。结果显示ChatGPT-5、Gemini 2.5 Flash、Claude Sonnet 4.5、Grok 4和DeepSeek V3.2的准确率均低于...