Anthropic最新AI风险报告披露未发布的Model 2及新对齐问题
Anthropic在最新发布的186页AI对齐报告中,披露了两款Claude Mythos 5的后继模型Model 1和Model 2,其中Model 2已被公司员工大量使用,在多项内部任务中表现优于Mythos 5。报...
Anthropic在最新发布的186页AI对齐报告中,披露了两款Claude Mythos 5的后继模型Model 1和Model 2,其中Model 2已被公司员工大量使用,在多项内部任务中表现优于Mythos 5。报...
中国AI开发商Z.ai推出开源大语言模型GLM-5.3,在多项主流基准测试中刷新纪录。该模型基于7530亿参数的混合专家架构,上下文窗口达100万tokens。GLM-5.3在Terminal Bench 3.0上创下开...
谷歌发布新模型Gemini 3.7 Flash,取代三周前推出的3.6 Flash。该模型在编程与智能体性能上有所提升,FrontierCode测试得分从34.4%升至43.6%,DeepSWE得分从49%升至65.3%...
英伟达发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,推理速度最高提升4倍,支持针对特定业务场景进行后训练优化。合作伙伴CrowdStrike、CodeRabbit等测试显示,经微调...
研究人员提出"知识画像"框架,系统区分大模型事实错误的两类根源:知识从未编码(空架子)与知识已编码但无法召回(丢钥匙)。基于2150条维基百科事实构建的WikiProfile基准测试显示,Gemini-3-Pro、GPT...
阿里巴巴发布了开源旗舰模型Qwen3.8-2.4T-A95B,总参数量达2.4万亿,每次推理激活参数约950亿。该模型采用细粒度MoE架构与全注意力/线性注意力混合机制,支持最长100万token上下文。在NVIDIA ...
OpenAI于7月初向全球用户开放GPT-5.6系列模型,包含Sol(旗舰版)、Terra(主流版)和Luna(轻量版)三个版本。开发者实测反馈呈现两极:有用户称Sol在数据库生成与错误纠错上表现优于Claude Opu...
NVIDIA发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,专为长时运行的智能体AI工作负载设计,输出速度提升4倍,任务完成速度提升30%。同步推出的开源库NeMo Switchya...
Meta宣布发布开源大语言模型Muse Glimmer,这是一款拥有300亿参数、支持12.8万token上下文窗口的模型,可在本地设备运行,采用Apache 2.0协议开源。同时,Meta承诺在未来几周内开放更强大的M...
Meta今日发布开源语言模型Muse Glimmer,拥有300亿参数,经量化等优化后内存占用压缩至20GB以下,可在消费级显卡的个人电脑上运行。该模型采用"推测解码"两步生成机制,提升响应速度,并针对长提示词、推理任务...