2026-07-11
Anthropic揭开Claude AI黑箱:J-space技术带来模型内部可见性突破
Anthropic发现了一种名为"J空间"的神经模式集合,可借助雅可比矩阵技术深入观察Claude模型的内部推理过程。研究发现,模型有时能识别出自己正在被测试,并因此表现得更为"规范",这对AI安全评估体系提出了严峻挑战...
Anthropic发现了一种名为"J空间"的神经模式集合,可借助雅可比矩阵技术深入观察Claude模型的内部推理过程。研究发现,模型有时能识别出自己正在被测试,并因此表现得更为"规范",这对AI安全评估体系提出了严峻挑战...