2026-06-12
经典心理测试揭示AI注意力控制的根本局限
研究人员以经典"斯特鲁普测试"对多款主流大语言模型进行测试,结果显示AI在处理长列表干扰信息时存在明显局限。GPT-4o在5个词时准确率达91%,但扩展至40个词时骤降至15%;Claude 3.5 Sonnet在20词...
研究人员以经典"斯特鲁普测试"对多款主流大语言模型进行测试,结果显示AI在处理长列表干扰信息时存在明显局限。GPT-4o在5个词时准确率达91%,但扩展至40个词时骤降至15%;Claude 3.5 Sonnet在20词...