Anthropic最新AI风险报告披露未发布的Model 2及新对齐问题
Anthropic在最新发布的186页AI对齐报告中,披露了两款Claude Mythos 5的后继模型Model 1和Model 2,其中Model 2已被公司员工大量使用,在多项内部任务中表现优于Mythos 5。报...
Anthropic在最新发布的186页AI对齐报告中,披露了两款Claude Mythos 5的后继模型Model 1和Model 2,其中Model 2已被公司员工大量使用,在多项内部任务中表现优于Mythos 5。报...
中国AI开发商Z.ai推出开源大语言模型GLM-5.3,在多项主流基准测试中刷新纪录。该模型基于7530亿参数的混合专家架构,上下文窗口达100万tokens。GLM-5.3在Terminal Bench 3.0上创下开...
谷歌正式推出其最新入门级AI模型Gemini 3.7 Flash,距前代产品发布仅三周。新模型在9项基准测试中超越Anthropic和OpenAI同类产品,在FrontierCode 1.1 Main编程任务评估中表现尤...
谷歌发布新模型Gemini 3.7 Flash,取代三周前推出的3.6 Flash。该模型在编程与智能体性能上有所提升,FrontierCode测试得分从34.4%升至43.6%,DeepSWE得分从49%升至65.3%...
英伟达发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,推理速度最高提升4倍,支持针对特定业务场景进行后训练优化。合作伙伴CrowdStrike、CodeRabbit等测试显示,经微调...
研究人员提出"知识画像"框架,系统区分大模型事实错误的两类根源:知识从未编码(空架子)与知识已编码但无法召回(丢钥匙)。基于2150条维基百科事实构建的WikiProfile基准测试显示,Gemini-3-Pro、GPT...
SpaceXAI(前身为xAI)发布新旗舰大语言模型Grok 4.6,距上一版本仅一个月。该模型通过AI生成数据集延长训练周期,并引入监督微调与强化学习两阶段优化,重点提升推理、科学及编程能力。在Artificial A...
阿里巴巴发布了开源旗舰模型Qwen3.8-2.4T-A95B,总参数量达2.4万亿,每次推理激活参数约950亿。该模型采用细粒度MoE架构与全注意力/线性注意力混合机制,支持最长100万token上下文。在NVIDIA ...
OpenAI于7月初向全球用户开放GPT-5.6系列模型,包含Sol(旗舰版)、Terra(主流版)和Luna(轻量版)三个版本。开发者实测反馈呈现两极:有用户称Sol在数据库生成与错误纠错上表现优于Claude Opu...
NVIDIA发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,专为长时运行的智能体AI工作负载设计,输出速度提升4倍,任务完成速度提升30%。同步推出的开源库NeMo Switchya...
Meta宣布发布开源大语言模型Muse Glimmer,这是一款拥有300亿参数、支持12.8万token上下文窗口的模型,可在本地设备运行,采用Apache 2.0协议开源。同时,Meta承诺在未来几周内开放更强大的M...
Meta今日发布开源语言模型Muse Glimmer,拥有300亿参数,经量化等优化后内存占用压缩至20GB以下,可在消费级显卡的个人电脑上运行。该模型采用"推测解码"两步生成机制,提升响应速度,并针对长提示词、推理任务...
Meta发布名为Glimmer的300亿参数开源权重模型,专为AI智能体任务设计,可在单块GPU上运行,支持MacBook等消费级设备。该模型旨在帮助用户调度多个AI智能体协同工作。与此同时,Meta还计划发布Spark...
阿里巴巴正式推出迄今最大AI模型Qwen3.8-Max,参数规模达2.4万亿,采用混合专家架构(MoE),推理时仅激活约950亿参数。该模型支持软件工程、多模态推理等企业级任务,开放权重版本将于下周通过阿里云Model ...
阿里巴巴发布迄今最大AI模型Qwen3.8-Max,参数规模达2.4万亿,采用混合专家架构,推理时仅激活约950亿参数。该模型专为软件工程、多模态推理等企业场景设计,开放权重版本将于下周通过阿里云模型工作室发布。阿里巴巴...
他说"你绝对是对的"的时候,你正在被奖励劫持 一个宗教系学生和一个自学程序员,怎么做出了估值15亿美元的开源AI 用Hermes改造了童年游戏的地图,他说这比写代码更让他兴奋。
阿里巴巴正式推出Qwen系列最新旗舰模型Qwen3.8-Max,参数总量达2.4万亿,约为2月发布的Qwen3.5的7倍,每次推理激活950亿参数。该模型支持最高100万token的上下文输入,可处理逾200页文本或约1...
研究人员提出Chain-of-Evidence(CoE)框架及Science One原型系统,旨在解决AI自主科研中的幻觉问题。该框架要求每项研究声明必须附有可追溯的证据链,并通过CoE Audit协议自动审核AI生成论...
Anthropic于7月24日发布Claude Opus 5,该模型在编程、知识任务及智能体能力方面大幅提升,性能接近Claude Fable 5,但价格仅为其一半。在Frontier-Bench v0.1基准测试中,O...
谷歌CEO桑达尔·皮查伊在季度财报电话会议上回避了Gemini 3.5 Pro延迟发布的问题,转而宣布Gemini 4的开发计划及近乎每月一次的模型发布节奏。分析人士指出,虽然延迟尚未引发客户大规模流失,但已令企业CIO...