使用量化感知蒸馏技术构建Nemotron 3.5 Lightning NVFP4模型
NVIDIA通过量化感知蒸馏(QAD)技术,将Nemotron 3.5 Lightning模型从66GB压缩至22GB的NVFP4格式,在保持精度的同时实现最高4倍吞吐量提升。QAD以全精度BF16模型为教师,通过KL散...
NVIDIA通过量化感知蒸馏(QAD)技术,将Nemotron 3.5 Lightning模型从66GB压缩至22GB的NVFP4格式,在保持精度的同时实现最高4倍吞吐量提升。QAD以全精度BF16模型为教师,通过KL散...
Anthropic在最新发布的186页AI对齐报告中,披露了两款Claude Mythos 5的后继模型Model 1和Model 2,其中Model 2已被公司员工大量使用,在多项内部任务中表现优于Mythos 5。报...
中国AI开发商Z.ai推出开源大语言模型GLM-5.3,在多项主流基准测试中刷新纪录。该模型基于7530亿参数的混合专家架构,上下文窗口达100万tokens。GLM-5.3在Terminal Bench 3.0上创下开...
谷歌发布新模型Gemini 3.7 Flash,取代三周前推出的3.6 Flash。该模型在编程与智能体性能上有所提升,FrontierCode测试得分从34.4%升至43.6%,DeepSWE得分从49%升至65.3%...
英伟达发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,推理速度最高提升4倍,支持针对特定业务场景进行后训练优化。合作伙伴CrowdStrike、CodeRabbit等测试显示,经微调...
研究人员提出"知识画像"框架,系统区分大模型事实错误的两类根源:知识从未编码(空架子)与知识已编码但无法召回(丢钥匙)。基于2150条维基百科事实构建的WikiProfile基准测试显示,Gemini-3-Pro、GPT...
SpaceXAI(前身为xAI)发布新旗舰大语言模型Grok 4.6,距上一版本仅一个月。该模型通过AI生成数据集延长训练周期,并引入监督微调与强化学习两阶段优化,重点提升推理、科学及编程能力。在Artificial A...
阿里巴巴发布了开源旗舰模型Qwen3.8-2.4T-A95B,总参数量达2.4万亿,每次推理激活参数约950亿。该模型采用细粒度MoE架构与全注意力/线性注意力混合机制,支持最长100万token上下文。在NVIDIA ...
OpenAI于7月初向全球用户开放GPT-5.6系列模型,包含Sol(旗舰版)、Terra(主流版)和Luna(轻量版)三个版本。开发者实测反馈呈现两极:有用户称Sol在数据库生成与错误纠错上表现优于Claude Opu...
NVIDIA发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,专为长时运行的智能体AI工作负载设计,输出速度提升4倍,任务完成速度提升30%。同步推出的开源库NeMo Switchya...