Sam Altman承认GPT-6发布"混乱"引担忧
OpenAI新模型GPT-6 Astra发布后出现访问问题,付费用户一度无法使用,CEO Altman为此道歉,公司正分阶段扩大开放范围。
OpenAI新模型GPT-6 Astra发布后出现访问问题,付费用户一度无法使用,CEO Altman为此道歉,公司正分阶段扩大开放范围。
Mach Industries完成6亿美元C轮扩展融资,估值达37亿美元,较6月翻倍。公司生产无人军事装备,投资方包括Sequoia、Ribbit Capital等。
埃森哲宣布新建Gemini Enterprise业务组,计划部署1000名前沿工程师,帮助企业客户解决AI落地难题,该团队隶属谷歌业务组并将获谷歌云FDE认证。
苹果推出首款折叠设备iPhone Duo,搭载A20 Pro芯片,内屏7.6英寸、外屏5.4英寸,售价1999美元,10月23日上市。
多名数学家指控OpenAI在宣布重大数学突破前,可能未经许可使用了其与ChatGPT交流中的未公开研究成果,并批评公司回应含糊、缺乏透明度。
一家企业面对200多个内部应用抢占同一批GPU资源,通过分析生产流量找出指令遵循、工具调用、任务分布三大短板,分别训练强化学习专家再合并权重,最终用320亿参数模型吃下50%流量,超越七倍参数量的大模型,成本降低数倍。
论文提出递归再生数RAI,衡量AI辅助AI研发何时从普通加速转变为自我放大的临界状态,发现该转变取决于反馈结构而非智能水平本身,并揭示多机构网络可能比单一机构更早触发这一临界点。
论文提出SMELT架构,在训练算力、参数量、KV缓存三项预算严格对齐的前提下,让循环中间层两次的MoE Transformer持续跑赢普通模型,最高省下18%训练算力,并揭示第二次循环通过降低注意力沉没提升长文本与上下文...
上海AI实验室提出Safin-1,通过MARCH架构让循环模型能检索历史状态记忆,并首次将安全能力做成可插拔的持久状态,与上下文记忆共用路由机制,在4B与35B规模上实现能力提升与更优的安全过度拒绝平衡。
论文发现知识蒸馏在中期训练阶段会让语言模型推理能力提升但事实记忆下降,研究者提出按教师预测熵路由的开关蒸馏方法,在保留推理增益的同时几乎完全保住事实记忆,效果延续到后训练阶段。
Pera是复旦大学等机构提出的持久AI智能体架构,主张智能体不仅要完成单次任务,还需持续感知环境变化,主动维护和更新自身服务能力,实现真正的长期陪伴式智能服务。
本文介绍StudentSim框架,通过池化训练与个体特化两阶段方法,训练出既能复现真实学生答题习惯又能响应老师指导的AI学生模拟器,在国际象棋、英语写作、数学三大领域超越GPT-5.4等闭源模型,并可反哺AI辅导老师的强...
多跳问答里,问题和证据的颗粒度常常对不上。Hi-Q提出让证据说了算,先测试查询能否被解决,不能才拆解,还能保证子问题按依赖顺序执行,在多个基准上超过图检索和迭代检索方法。
统一多模态模型能否让视觉理解和生成互相促进?论文从表征、任务、系统三层面揭示:架构设计决定协同或冲突,共享知识的任务能双向提升,端到端模型在复杂任务上优于分步流水线。
ZimaBlue是一个从超12万小时第一视角视频中学习机器人操作能力的世界动作模型,通过三阶段训练和Slow-Fast双系统架构,将零样本任务成功率从36.1%提升到77.8%,同时把控制延迟压缩到33毫秒。
IBM与Lockheed Martin联合苏黎世联邦理工建立瑞士量子创新中心,将于2026年底部署瑞士首台IBM Quantum System Two,搭载120量子位Nighthawk r2处理器,服务化学、材料、优化...