学霸还是学渣,数学能力训练到底提升了什么?深度揭秘大模型能力迁移的秘密
卡内基梅隆大学发布了他们的一项最新研究,他们对20多个开源推理模型进行了后训练,涵盖数学推理、科学问答、代码生成、指令遵循等多个维度,最终发现,数学能力优异的模型,在其他任务上表现平平,甚至还不如未加强数学推理能力的原始...
大模型到底哪家强?红杉xbench:告别刷题时代,AI评测应该以解决问题的能力为基准
Xbench是知名投资机构红杉中国推出一款全新的AI基准测试工具,旨在真实地反映AI的客观能力,其在评估和推动AI系统提升能力上限与技术边界的同时,会重点量化AI系统在真实场景的效用价值,并采用长青评估的机制,去捕捉AI...
神经网络的“睡眠周期”:AI竟然也需要休息来提升学习效果
在我们的日常生活中,睡眠的重要性不言而喻。一个晚上没睡好,第二天的工作效率就会大打折扣,而充足的睡眠不仅能让我们恢复精力,还能帮助大脑整理和巩固当天学到的知识。有趣的是,AI模型竟然也表现出了类似的“睡眠需求”。
阿里通义实验室推出WebSailor:首个与顶级闭源系统媲美的开源超级网络智能体
阿里通义实验室发布首个媲美顶级闭源系统的开源超级网络智能体WebSailor,突破性解决开源模型在超高不确定性任务中的系统性推理难题,在BrowseComp基准测试准确率提升3倍,标志着开源技术在复杂信息搜索领域的历史性...
OpenAI投资人Vinod Khosla:AI如何五年掌握80%工作技能?
作为第一个向OpenAI进行风险投资的投资人(也是一个鹰派),Khosla在2019年向该公司投资了5000万美元,这笔投资如今价值超过40亿美元,成为其投资生涯中最具传奇色彩的案例之一。在这次深度访谈中,他预测人工智能...
调研了300家企业,ICONIQ 发布《开发者手册:2025年AI现状报告》,揭秘企业AI落地的全景路线
知名的投资机构ICONIQ Capital发布了《开发者手册:2025年AI现状报告》,基于对300位企业高管的调研,包括CEO、工程负责人、AI负责人和产品负责人等关键决策者,涵盖了从初创公司到十亿美元巨头的各个发展阶...
多模态智能时代,AI模型遭遇“空间推理危机"——苏黎世联邦理工学院的MARBLE基准测试挑战来袭!
当AI遇到空间推理难题:最新研究揭示GPT-4等顶尖模型在传送门解谜和立体拼图中集体"挂科",复杂智能远比我们想象的更难实现。
Meta CFO 苏珊·李:从19岁华尔街分析师到Fortune 100最年轻CFO,17年见证扎克伯格的领导力变化与AI转型
Meta以1亿美元天价争夺AI人才之际,CFO苏珊·李揭秘资本配置艺术:"当扎克伯格一年烧掉600亿建设AI时,我的工作不仅是算清每笔账,更要向骂街的投资者证明——疯狂支出终有回报。"这位19岁闯华尔街的财务奇才,用17...
玩家秒变造物主!170亿参数AI实时编织你的游戏世界
当你在《我的世界》中跳跃时,AI能瞬间将你的想法变成脚下奔涌的虚拟河流——Skywork AI的Matrix-Game模型让键盘成为拨动虚拟世界的开关,170亿参数的“造物主”实时编织出符合你意图的动态场景,重新定义人机...
字节跳动重磅突破!AI视频生成告别"复制粘贴"时代,一张照片秒变千种场景
字节跳动智能创作实验室发布革命性AI视频数据集Phantom-Data,解决视频生成中的"复制粘贴"问题。该数据集包含100万个跨场景身份一致配对,通过三阶段构建流程实现主体检测、多元化检索和身份验证,显著提升文本遵循能...
谷歌DeepMind发布AlphaEvolve:会自己编程进化的AI智能体,破解56年未解数学难题
谷歌DeepMind发布AlphaEvolve:会自己编程进化的AI智能体,破解56年未解数学难题
216年过去了,人类离攻克癌症还有多远?AI医疗或许会是那个“破局者”
AI能让够更早,更准确的发现并预测癌变的发生,这也是目前AI医疗的的一个主流发展方向,更早的发现,更准确的预测。最近一项来自美国国立卫生研究院(NIH)的研究就在对肺癌精准预测方向上取得了重大突破


















