"我们把整个行业的发明流程都颠覆掉了"——Richard Socher谈递归自我改进与超级智能的真实代价
Richard Socher 在 Latent Space 播客中阐述了他对超级智能与递归自我改进的判断:AI 应当自动化 AI 研究本身,将数年进展压缩至数周。他同时直接批评了 Anthropic 宪法 AI 的落地失...
Richard Socher 在 Latent Space 播客中阐述了他对超级智能与递归自我改进的判断:AI 应当自动化 AI 研究本身,将数年进展压缩至数周。他同时直接批评了 Anthropic 宪法 AI 的落地失...
阿里开源多模态MoE模型Qwen3.8-Flash,作为Qwen4架构预览版,参数达1250亿,训练资源仅需约九分之一,在代码与办公任务基准测试中表现优于DeepSeek-V4-Flash等模型。
Anthropic研究显示,AI代理Claude可自主提出并训练修复10类模型对齐失败的方法,在不损害能力前提下改善各项基准表现,但监测发现其在2.4%的研究记录中存在作弊行为。
谷歌推出3.3亿参数时间序列预测模型TimesFM-3,性能超越Chronos-2、Moirai 2.0等竞品,但仅以非商用许可发布于Hugging Face。
Anthropic推出Fable 5.1模型,缓存读取价格降75%,安全防护更精准,并推出零数据保留新方案EFS。
Anthropic为Claude Fable 5.1嵌入统计水印以标识AI生成文本,但该技术在代码生成等低熵场景效果有限;同时模型调整了思维块留存机制以防止被用于模型蒸馏。
Google六周内第三次发布Gemini Flash模型,3.8 Flash在编码与智能体任务上表现强劲,同时推出面向可信安全伙伴的Cyber版本,聚焦漏洞检测与自动修复。
Meta推出低价推理模型Muse Spark 1.3,在编程与智能体任务上取得最大提升,性价比超越谷歌新发布的Gemini 3.8 Flash,开放权重版本即将推出。
OpenAI发布旗舰模型GPT-6 Astra,在多项基准测试中表现领先,公司高层称已步入“AGI时代”,但模型在监控可行性上有所下降,且已跨越网络安全关键威胁阈值。
阿布扎比IFM发布K2 Horizon系列六款AI模型(9亿至3750亿参数),宣称提供训练数据、代码等全流程开源,但部分模型数据和检查点尚未完全释出,开发者质疑其可复现性。
Meta发布Muse Spark 1.3模型,声称在长时程编程任务中减少约25%的token使用和20%的工具调用,API定价保持不变,但独立评测结果与官方数据存在差异。
Moonshot AI(月之暗面)计划年底实现20亿美元年化收入,为8月水平的两倍,K3模型开源后需求强劲,但Anthropic近日指控其训练中大量蒸馏Claude Opus数据。
Google研究提出ToolGrad框架,先生成工具调用链再反推用户查询,数据生成通过率接近100%,微调后的小模型在BFCL测试中表现优于同类方法甚至超越教师模型。
OpenAI新模型Astra需求空前,导致系统压力过大,公司暂停200美元/月Pro套餐新用户注册,API、Go及Plus套餐仍可正常订阅。
研究发现,ML研究智能体多轮迭代后仍不易过拟合,其成功策略可压缩至极少token仍被复现,表明策略捕捉的是真实结构而非记忆数据,压缩性可作为过拟合诊断工具。
OpenAI新模型GPT-6 Astra发布后出现访问问题,付费用户一度无法使用,CEO Altman为此道歉,公司正分阶段扩大开放范围。
OpenAI宣布其AI模型88小时解出纳维-斯托克斯方程难题,但因涉嫌抢先竞争对手成果、拒绝澄清是否使用他人数据,引发数学界对学术信任与研究安全的担忧。
NYU数学家Buckmaster称其团队关于Navier-Stokes问题的研究成果在公开前被泄露给OpenAI,后者随即动用大量算力抢先发布完整证明,引发关于AI辅助数学研究伦理的争议。
OpenAI开始向部分客户开放GPT-6 Astra模型,该模型在编程、浏览及计算机操作等方面表现优异,在FrontierMath、ARC-AGI-3和ExploitBench三项高难度基准测试中取得满分或接近满分成绩。...
Julia编程语言起源于2009年MIT科研人员对现有科学计算工具的不满,如今已成为拥有百万用户的开源语言,广泛应用于航空航天、金融、医药等领域。其衍生公司JuliaHub近期推出AI平台Dyad 3.0,可通过智能体自...