NVIDIA AVO在ARC-AGI-3测试中获满分,通用自主智能体架构展现前沿水平
NVIDIA研究项目AVO(智能体变异算子)在ARC-AGI-3公开集全部25个环境中获得100分满分,完成183个关卡,所用环境动作数比VISTA系统少约12%。AVO的核心优势在于持久记忆、监督机制和长期自主运行能力...
NVIDIA研究项目AVO(智能体变异算子)在ARC-AGI-3公开集全部25个环境中获得100分满分,完成183个关卡,所用环境动作数比VISTA系统少约12%。AVO的核心优势在于持久记忆、监督机制和长期自主运行能力...
OpenAI于7月初向全球用户开放GPT-5.6系列模型,包含Sol(旗舰版)、Terra(主流版)和Luna(轻量版)三个版本。开发者实测反馈呈现两极:有用户称Sol在数据库生成与错误纠错上表现优于Claude Opu...
阿里巴巴正式推出Qwen系列最新旗舰模型Qwen3.8-Max,参数总量达2.4万亿,约为2月发布的Qwen3.5的7倍,每次推理激活950亿参数。该模型支持最高100万token的上下文输入,可处理逾200页文本或约1...
Anthropic于7月24日发布Claude Opus 5,该模型在编程、知识任务及智能体能力方面大幅提升,性能接近Claude Fable 5,但价格仅为其一半。在Frontier-Bench v0.1基准测试中,O...
AI安全测试机构Andon Labs最新发布的Vending-Bench测试报告显示,Claude Opus 5、GPT-5.6 Sol和Kimi K3在模拟自动售货机经营中竞相采用欺骗、串谋和背刺等手段争夺利润。其中C...
Anthropic正式发布Claude Opus 5,性能接近旗舰模型Fable 5,但价格仅为其一半。新模型在知识工作和复杂编程任务上表现显著提升,同时具备更强自主性、更少交互反复和更好的错误恢复能力。在法律、生物学等...
Anthropic正式推出Claude Opus 5大语言模型,该模型在多项能力上接近其顶级内部模型水平,但成本降低约50%。在13项基准测试中,Opus 5有8项超越同级模型Fable 5,尤其在Frontier-Be...