OpenAI推出GPT-6 Sol和Luna,成本更低错误更少
OpenAI推出GPT-6 Sol和Luna模型,API访问价格较5.6系列降低50%,主要得益于缓存与推理效率提升。Sol的内部事实准确性评估显示错误率减半,已向付费用户开放,并将逐步覆盖免费用户。
OpenAI推出GPT-6 Sol和Luna模型,API访问价格较5.6系列降低50%,主要得益于缓存与推理效率提升。Sol的内部事实准确性评估显示错误率减半,已向付费用户开放,并将逐步覆盖免费用户。
OpenAI与Anthropic于同一天发布新模型:OpenAI推出GPT-6 Sol和Luna,错误率减半并向低预算用户开放;Anthropic发布Claude Opus 5.5,成本较Opus 5降低约40%,并强调...
Anthropic发布Opus 5.5,输入/输出Token价格较前代降低20%,缓存读取成本降低60%;OpenAI同步推出GPT-6 Sol和Luna,能力小幅提升但价格减半。两家公司均以降低成本为核心,应对开源模型...
TypeSafe联合创始人兼CEO Diogo Almeida在Jev发布数天后做客Latent Space播客,讲述他为何要打造一类被称为"System One模型"的机器原生AI——让代码而非人类成为模型输出的消费者...
本文系统介绍了AI Agent评估体系的演进,阐述了步骤级与端到端两种评分机制的区别,并以SWE-bench和NVIDIA Nemotron 3.5 Lightning为例,说明工具调用已成为现代基准测试的核心基础,建议...
SpaceX推出迄今最强大语言模型Grok 4.7,采用全新基础模型与强化学习工作流,支持多AI智能体并行处理复杂任务。在CursorBench 4.0基准测试中,平均每任务成本4.69美元,优于GPT-5.6 Sol;...
世界模型领域两大玩家AMI Labs和World Labs融资颇丰,却对产品方向讳莫如深。从制造业、生物医学到机器人,应用方向繁多,但创始人和供应商均表示对商业化路径知之甚少,背后是技术多用途性与竞争压力的双重考量。
PrismML推出第二代超紧凑多模态AI模型Bonsai 2 27B,基于Qwen3.8采用三值压缩技术,将56GB模型压缩至5.9GB,保留约98.2%能力,可在RTX 5090或苹果M5 Max上无需量化运行。
OpenAI前研究员创立的TypeSafe AI本周发布transformer模型Jev,该模型不输出文本,而是生成"校准决策"概率值,无法产生幻觉。其输出token免费,速度比LLM快5至20倍,成本大幅降低,已在软件...
AI基准测试初创公司Vals完成a16z领投的4000万美元A轮,营收同比增长8倍;公司通过私密测试材料评估模型在法律、金融等行业的实际能力,并已向联邦机构提供评测服务。
OpenAI两位数学家马克·塞尔克与梅塔布·索万尼在a16z播客中,从埃尔德什开放问题、单位距离猜想等具体案例出发,解析GPT-5为何能在数学证明中做出接近人类专家的"正确下注",以及它为何比人类更擅长从错误路径中抽身重...
a16z 播客邀请 Vals 创始人 Rayan Krishnan,深度拆解 AI 模型评测行业的核心困境:Llama 4 发布时公开榜单与私有测试结果的巨大落差,暴露了"自报成绩"体系的失效;Vals 如何在模型发布前...
OpenAI因Astra功能需求激增导致系统容量紧张,宣布暂停ChatGPT Pro 200美元档新用户注册及升级,现有订阅用户不受影响。
NVIDIA黄仁勋在Salesforce Dreamforce大会宣布,双方合作推出基于NVIDIA Nemotron 3 Super的CRM推理模型Koa,已在Slack内部使用,10月起进入客户试点。
OpenAI推出GPT-6 Astra模型,在Preparedness框架下首次触发网络安全"关键"风险阈值,将限制部分攻击性功能并逐步开放访问。
文章解析Dense与MoE两种模型架构差异,以Nemotron 3.5 Lightning为例说明MoE如何用3B激活参数实现30B模型容量,并给出内存、并发、微调等场景选型建议。
Salesforce与英伟达合作推出首款推理模型Koa,基于Nemotron开放权重模型训练,专为销售与客服场景优化,未使用客户真实数据,可降低企业AI使用成本。
OpenAI发布GPT-6 Astra并宣称已进入AGI时代,总裁格雷格·布罗克曼的表态耐人寻味。Big Technology Podcast主持人亚历克斯·坎特罗维茨与嘉宾兰詹·罗伊就此展开辩论:这究竟是技术真的跨过门...