如何评估AI智能体:从工具调用到任务完成
本文系统介绍了AI Agent评估体系的演进,阐述了步骤级与端到端两种评分机制的区别,并以SWE-bench和NVIDIA Nemotron 3.5 Lightning为例,说明工具调用已成为现代基准测试的核心基础,建议...
本文系统介绍了AI Agent评估体系的演进,阐述了步骤级与端到端两种评分机制的区别,并以SWE-bench和NVIDIA Nemotron 3.5 Lightning为例,说明工具调用已成为现代基准测试的核心基础,建议...
NVIDIA Dynamo-Triton 26.07新增TensorRT多设备推理能力,单个Triton实例可调度最多8块GPU协同执行,以Cosmos 3 Nano视频生成为例,端到端延迟从156.6秒降至34.2秒,...
SpaceX推出迄今最强大语言模型Grok 4.7,采用全新基础模型与强化学习工作流,支持多AI智能体并行处理复杂任务。在CursorBench 4.0基准测试中,平均每任务成本4.69美元,优于GPT-5.6 Sol;...
Google与Georgia Power签署协议,支持Plant Vogtle和Plant Hatch两座核电站的扩容升级,预计新增约96兆瓦发电容量。Google将订阅新NU-1关税方案并获得零排放信用额度,该协议预计...
苹果零售之父Ron Johnson认为,AI将提升购物信息获取体验,但不会改变消费者对实体店的依赖。他指出,笔记本电脑等高价品太过个人化,消费者仍需亲身体验,AI代理无法替代这一环节。
淘宝直播数字人主播需要低延迟且能跟随策略更新。TaoLive团队提出Harness-Aware Training三阶段训练法,让轻量模型学会理解动态变化的运行时配置,线上A/B测试显示GMV提升4.33%,浏览量提升0....
与传统集中式存储更多承载数据库、虚拟化和文件共享等通用业务相比,FN Neo将KV Cache纳入存储管理范围,希望用一套存储承载中小规模私有化推理中的多类数据。
牛津团队发布LibriBrain100,一份超100小时的脑磁图语音解码数据集,单人贡献80小时创下纪录,并新增32人浅层数据验证跨人迁移,推动非侵入式脑机接口标准化评测。
清华与Navers Lab团队提出SWE Refactor Bench,用三阶段评测揭穿AI编程智能体的"迁移作弊":仅520次测试中28次真正完成整仓库技术栈迁移,最强模型也只得47分,暴露出完成迁移与保持行为正确是两...
本文解读2014年Simonyan与Zisserman提出的双流卷积网络,介绍其如何用空间流与时间流两条独立分支分别处理图像外观与光流运动信息,首次让深度学习在视频动作识别任务上超越传统手工特征方法,准确率达到88%,并...
吉利计划于9月23日在宁波全球发布新一代智能充电技术,充电功率达2.2MW,较比亚迪闪充2.0系统高约50%,可实现约4分钟充电。该系统还宣称支持3500次充放电循环且衰减有限。
据Apptopia数据,Meta旗下AI应用Muse上线12天内在iOS平台的美国和加拿大市场获得180万次下载,超过ChatGPT同期的130万次;其美国日活跃用户达64.2万,亦高于ChatGPT当时的23.1万。
OpenAI宣布在普林斯顿高等研究院设立数学与AI顾问组,旨在为数学家提供对公司数学研究的意见渠道。OpenAI同时声称其内部模型已解决超过100个数学开放性问题,但该顾问组无权干预公司内部研究节奏。
城市学院本科生Marina Milea通过MIT BSG-MSRP-Bio暑期项目,在Koch癌症研究所Jacks实验室研究KRAS突变肺癌的腺鳞转化耐药机制,掌握多项前沿实验技术,并计划攻读生物医学博士。
今天讲的出海案例是满坤科技,这家从事印制电路板制造的企业正在泰国建设工厂,面向AI服务器电源高多层板等需求,预计2027年开始陆续投产。
这篇论文提出了双流卷积网络,首次让深度学习在视频动作识别任务上追平了手工特征方法密集轨迹的准确率(约88%)。核心思路是用两个独立网络分别处理画面外观(空间流)和运动信息(时间流,基于光流场),再融合判断结果,同时用多任...
这篇论文提出了首个针对土耳其语的自然对话多模态语料库Real-TurnTurk,包含4.23小时同步视频、分轨音频与转录文本,并用遗传算法从视觉、声学、语言三类特征中进化出可解释的"与-或"规则来预测话轮转换,F1达到5...
2014年,双流网络首次让深度学习在视频动作识别上追平并反超手工特征方法。论文把视频理解拆成静态内容识别和运动模式识别两支网络,用光流场作为运动信息的预处理输入,在UCF-101上做到88%准确率,开启了后续视频理解研究...