2026-04-27
DeepSeek V4发布:效率大幅提升,支持华为昇腾NPU
DeepSeek发布新一代开源大语言模型V4,包含2840亿参数的Flash版和1.6万亿参数的Pro版。V4-Pro经33万亿token训练,性能据称超越所有开源模型并媲美西方顶级商业模型。新模型引入混合注意力机制与F...
DeepSeek发布新一代开源大语言模型V4,包含2840亿参数的Flash版和1.6万亿参数的Pro版。V4-Pro经33万亿token训练,性能据称超越所有开源模型并媲美西方顶级商业模型。新模型引入混合注意力机制与F...
阿里巴巴发布Qwen3.5人工智能模型,声称在某些任务上超越GPT-5.2和Claude 4.5 Opus。该开源模型采用专家混合架构,拥有3970亿参数,每次推理仅激活170亿参数,支持262,144个token的上下...
马斯克旗下xAI开源了Grok-1,一个3140亿参数的混合专家模型,成为迄今为止参数量最大的开源LLM。Grok-1未针对特定任务微调,使用JAX和Rust自定义训练堆栈训练。项目在GitHub上迅速获得关注,马斯克借...