循环两次的Transformer,怎么用同样的算力训练出更聪明的大模型
论文提出SMELT架构,在训练算力、参数量、KV缓存三项预算严格对齐的前提下,让循环中间层两次的MoE Transformer持续跑赢普通模型,最高省下18%训练算力,并揭示第二次循环通过降低注意力沉没提升长文本与上下文...
论文提出SMELT架构,在训练算力、参数量、KV缓存三项预算严格对齐的前提下,让循环中间层两次的MoE Transformer持续跑赢普通模型,最高省下18%训练算力,并揭示第二次循环通过降低注意力沉没提升长文本与上下文...
Arm 开发者关系副总裁 Shantu Roy上台,抛出了一个直击痛点的产业判断:“AI应用的构建,正在从‘以模型为中心(model-centric)’转向‘以系统为中心(system-centric)’。”
上海AI实验室提出Safin-1,通过MARCH架构让循环模型能检索历史状态记忆,并首次将安全能力做成可插拔的持久状态,与上下文记忆共用路由机制,在4B与35B规模上实现能力提升与更优的安全过度拒绝平衡。
论文发现知识蒸馏在中期训练阶段会让语言模型推理能力提升但事实记忆下降,研究者提出按教师预测熵路由的开关蒸馏方法,在保留推理增益的同时几乎完全保住事实记忆,效果延续到后训练阶段。
近日,在华大集团2026全球新品发布会期间,华大集团首席执行官尹烨来到生态合作伙伴金山办公的展位,展开新一轮合作交流。
企业私有云选型看似是在比较计算、存储和网络功能,实际决定项目成败的往往是另一组问题:存量硬件能否利旧,多套资源池能否统一管理,虚拟机与容器是否需要两套平台,服务目录和审批能否落地,以及三年后扩建数据中心时是否需要重新建设...
Arm AI Portal 将超过 2,200 万开发者及其智能体连接至 Arm 计算平台上的优化 AI 软件,覆盖云、边缘和物理 AI。
9 月 9 日至 13 日,2026 年中国国际服务贸易交易会在北京首钢园举办。作为会议专题活动,由中国信息协会主办的,以「智启未来 应用无界——从模型创新到场景落地」为主题的“2026中国AIGC创新应用交流会”于 9...
Pera是复旦大学等机构提出的持久AI智能体架构,主张智能体不仅要完成单次任务,还需持续感知环境变化,主动维护和更新自身服务能力,实现真正的长期陪伴式智能服务。
本文介绍StudentSim框架,通过池化训练与个体特化两阶段方法,训练出既能复现真实学生答题习惯又能响应老师指导的AI学生模拟器,在国际象棋、英语写作、数学三大领域超越GPT-5.4等闭源模型,并可反哺AI辅导老师的强...
多跳问答里,问题和证据的颗粒度常常对不上。Hi-Q提出让证据说了算,先测试查询能否被解决,不能才拆解,还能保证子问题按依赖顺序执行,在多个基准上超过图检索和迭代检索方法。
统一多模态模型能否让视觉理解和生成互相促进?论文从表征、任务、系统三层面揭示:架构设计决定协同或冲突,共享知识的任务能双向提升,端到端模型在复杂任务上优于分步流水线。