让AI手机助手学会反思:一个训练时代之外的可能性
本文介绍EvoSkill-GUI,一个训练免费的GUI智能体技能进化框架,通过结构化技能包、即时修订、信息隔离的批评诊断和元数据检索,让智能体从执行失败中自我反思并持续改进,在多个手机电脑基准测试上取得显著成功率提升。
本文介绍EvoSkill-GUI,一个训练免费的GUI智能体技能进化框架,通过结构化技能包、即时修订、信息隔离的批评诊断和元数据检索,让智能体从执行失败中自我反思并持续改进,在多个手机电脑基准测试上取得显著成功率提升。
研究团队用标准nnU-Net模型测试脑肿瘤分割在跨病种场景下的泛化能力,发现验证集表现比内部测试低7.47个百分点,集成与增强等技巧收效甚微,小体积且碎片化的肿瘤是主要失败原因。
本文介绍AutoArk团队的Edge0推理引擎,通过训练预路由器提前一步预测专家路由、结合可拆卸恢复LoRA补丁,让35B参数混合专家大模型能在24GB内存的普通电脑上流畅运行,速度提升超80%。
MIT 博士生 Alex Zhang 以 Recursive Language Models 和 GPU Mode 社区闻名,在 Latent Space 播客中回顾了自己从一次无聊实习误打误撞进入 GPU 编程社区的经...
Barrett Lyon 曾经历飞机引擎空中骤停的生死瞬间,如今他把同样的冗余思维用在了重建互联网协议上。这篇文章梳理了他创办 DoxxNet 的动机:协议层创新停滞、VPN 治标不治本、运营商级 NAT 扼杀应用潜力,...
论文提出全景接地式描述任务,构建人工标注数据集PanoCaps与gPQ评价指标,并提出PANORAMA模型,将短语接地转化为掩码候选选择,在多项分割与描述基准上取得领先表现,兼顾描述完整性与定位精确度。
本文解读Salesforce提出的四种显存优化技术,针对MoE长上下文训练中专家调度、词表投影、梯度检查点、优化器状态四大内存瓶颈逐一攻克,实现百万token上下文训练,吞吐量最高提升10.4倍。
RAND Corporation发布21页政策分析报告,指出AI驱动的变革、公众对专业知识信任的侵蚀及政治权威格局的转变,正动摇政策分析的制度基础,呼吁该领域回归基本原则,推动制度设计、培训与研究治理现代化。
北京人形机器人创新中心提出Pelican-Sim 1.0,一个通用世界模型模拟器,融合28维统一动作数值与URDF渲染动作视频,配合稀疏MoE架构,实现跨机器人型号的动作预测,并在数据生成、策略评估、动作选择等下游任务中...
本文解读ReMoMask与ReMoMask-2,一种检索增强的文本驱动人体动作生成方法,提出分层双向动量对齐、拓扑结构化掩码、语义时空注意力等模块,并将检索空间迁移至生成器潜变量空间,实现更高保真度与更快推理速度。
AI智能体在正式接任务前能否自主决定如何预习陌生环境?论文提出任务无关的环境预处理框架,用元智能体在六大基准上对比固定策略,发现开放式自主学习总体更优,且能省去测试时的重复尝试。
论文提出ActionSplice框架,通过反事实状态迁移技术,让交互式视频世界模型能在生成过程中即时响应新动作指令,无需等待或重复计算,大幅提升画面响应速度与准确度。
北大团队用591次训练实验严格测试了8种RLVR数据挑选方法和3种自适应策略,发现它们均未能稳定超越简单的均匀随机训练,同时揭示评测题库覆盖不全会导致排名结论截然相反。
本文解读了一份泰语语音合成技术报告,研究团队用大型声音克隆模型OmniVoice处理15秒参考音频生成合成语料,训练出仅82M参数的固定音色学生模型Wayu-Paxa-TTS-Edge,在关键词准确率和停顿精度上部分超越...
Benchmark Radar是一个每日更新的AI基准测试搜索引擎,整合1283条来自四大权威源的评测记录,揭示近四成基准无分数、分数量纲难比较等真实问题,帮研究者查清评测证据来源。
机器人操作模型在实验室里表现优异,但换个摄像头角度就大幅失效。本文提出的潜在接口训练方法,通过先无图像训练动作逻辑、再用姿态监督的窄通道引入视觉信息,在四种主流架构上均提升了泛化能力,真实机器人实验成功率提升超60个百分...
视觉文档检索靠“后期交互”实现高精度,但每页要存上千个向量,存储代价巨大。KAUST团队发现向量分布其实只有五六维自由度,提出GLIE,仅存4个向量即可复原全部信息,压缩比大幅提升且无需重训模型。
研究者发现视频AI能看懂视频"发生了什么",却分不清"什么时候发生"。TempCloze通过让AI从视频片段中挑选正确的缺失中段,揭示了当前视频大模型在时间对齐能力上的系统性短板,远逊于其内容识别能力。
这篇论文提出EvoSafeHarness框架,针对不同AI模型和应用场景自动搜索定制化安全护栏,而非套用统一方案。在四个测试集上验证,攻击成功率大幅下降且不影响正常任务完成率,同一防御方案在不同模型场景下效果差异显著。
西湖大学团队提出World in World,一种无需训练的接口,让冻结的视频世界模型通过原生注意力机制读取多种视觉证据,实现对已录制视频的自由视角探索和事件同步重渲染,性能超越现有方法。