揭秘神秘AI模型Ox Alpha:Z.ai正式承认其GLM系列新作
周末,科技圈对匿名发布于OpenRouter的开源AI模型Ox Alpha展开热烈猜测,该模型已在多项基准测试中跻身榜首。彭博社证实,Ox Alpha出自GLM系列开发商Z.ai之手,是GLM系列最新迭代版本。Z.ai将...
周末,科技圈对匿名发布于OpenRouter的开源AI模型Ox Alpha展开热烈猜测,该模型已在多项基准测试中跻身榜首。彭博社证实,Ox Alpha出自GLM系列开发商Z.ai之手,是GLM系列最新迭代版本。Z.ai将...
a16z投资合伙人Anish Acharya在播客中提出"多赢家"论,认为xAI两周内跻身模型三强证明AI模型格局远未定型;他同时指出,网络效应、品牌等传统护城河并未被低成本AI瓦解,唯有系统集成类护城河受到冲击,而企业...
IBM推出Granite 4.2开源大语言模型系列,提供3B、8B和30B三种参数规模版本,原生支持128K上下文窗口。该系列主打本地部署,8B和30B版本经过强化学习训练,支持终端操作、网络搜索和外部工具调用。Gran...
IBM发布Granite 4.2语言模型,提供3B、8B和30B三种参数规模,专为企业级智能体工作流设计。该模型内置"思考"能力,支持逐步推理、工具调用和多阶段强化学习训练。同步发布的Granite Speech 5.0...
斯坦福研究员朱恩·成·朴从"Smallville"生成式智能体实验出发,创立 Simile AI,致力于构建人类行为基础模型。他解释了为何前沿大模型难以真实模拟人类行为、为何好的模拟必须重现人类的偏见与错误,以及如何通过...
DeepSeek推出旗舰V4系列新成员V4 Flash Vision Exp,该模型目前仅向付费开发者开放。在七项文本基准测试中,新模型在六项上超越前代V4 Flash;在图像分析领域提升尤为显著,两项视觉测试得分高出逾...
中国AI公司Z.ai发布GLM-5.3模型,声称在复杂编码和长周期任务上较GLM-5.2提升50%,改进完全来自后训练优化,包括推理对齐、监督微调和RLHF。然而,多位开发者对此持保留态度:有人怀疑模型能力源于对Anth...
阿里巴巴发布Qwen3.8-27B稠密模型,采用Apache 2.0开源协议,支持在配置较好的MacBook Pro或Mac Studio本地运行。据阿里巴巴基准测试,该模型性能与Anthropic Claude Opu...
OpenAI近期发布AI模型一次性解决10个数学难题,在数学界引发轩然大波。该模型在抽象数学领域表现卓越,但基础算术仍存在缺陷。数学家们面临存在主义危机:AI能否替代人类数学家?博士生研究方向可能在四年内被AI攻克。有学...
谷歌发布Gemini 3.7 Flash模型,定价为每百万输入token 0.75美元、输出3.75美元,约为上一版本的一半。新模型距3.6 Flash发布仅三周,重点提升编程、调试及多步骤自动化能力。在Frontier...
DeepSeek宣布对其V4模型系列API进行调价,部分价格涨幅高达1100%。新定价采用峰值/非峰值机制,非峰值享半价优惠。此次调价与V4-Pro正式发布及V4-Flash测试版推出同步进行,将于8月16日生效。分析师...
NVIDIA通过量化感知蒸馏(QAD)技术,将Nemotron 3.5 Lightning模型从66GB压缩至22GB的NVFP4格式,在保持精度的同时实现最高4倍吞吐量提升。QAD以全精度BF16模型为教师,通过KL散...
Anthropic近日披露了其为遵守欧盟《人工智能法案》而为Claude引入隐形文字水印的技术细节。该系统基于谷歌DeepMind开发的开源SynthID-Text方案,通过在文本生成过程中利用词语概率的随机选择,在输出...
Anthropic在最新发布的186页AI对齐报告中,披露了两款Claude Mythos 5的后继模型Model 1和Model 2,其中Model 2已被公司员工大量使用,在多项内部任务中表现优于Mythos 5。报...
中国AI开发商Z.ai推出开源大语言模型GLM-5.3,在多项主流基准测试中刷新纪录。该模型基于7530亿参数的混合专家架构,上下文窗口达100万tokens。GLM-5.3在Terminal Bench 3.0上创下开...
谷歌正式推出其最新入门级AI模型Gemini 3.7 Flash,距前代产品发布仅三周。新模型在9项基准测试中超越Anthropic和OpenAI同类产品,在FrontierCode 1.1 Main编程任务评估中表现尤...
谷歌发布新模型Gemini 3.7 Flash,取代三周前推出的3.6 Flash。该模型在编程与智能体性能上有所提升,FrontierCode测试得分从34.4%升至43.6%,DeepSWE得分从49%升至65.3%...
英伟达发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,推理速度最高提升4倍,支持针对特定业务场景进行后训练优化。合作伙伴CrowdStrike、CodeRabbit等测试显示,经微调...
研究人员提出"知识画像"框架,系统区分大模型事实错误的两类根源:知识从未编码(空架子)与知识已编码但无法召回(丢钥匙)。基于2150条维基百科事实构建的WikiProfile基准测试显示,Gemini-3-Pro、GPT...