栏目上新
推荐专题
AI助手帮你查文件,会不会顺手把你的密码本传到云端?
本文解读SEAD框架,将AI智能体的攻防问题建模为部分可观测的状态控制。提出的DART攻击方法通过树搜索与执行反馈动态拆解有害目标,SAGE防御方法通过只读查询在执行前评估动作风险,在良性保留率与攻击拦截率之间取得优异平...
微软如何为AI智能体设限防失控
微软发布Microsoft Execution Containers(MXC),通过沙箱隔离限制AI Agent的文件与网络访问权限,提供推荐、锁定和无限制三档访问级别,并支持资源使用监控,现已正式上线。
机器人一步就能做对动作,但十步才做得稳,怎么办?
本文介绍AnyStep WAM框架,通过教师轨迹蒸馏训练支持任意去噪步数的机器人操作模型,并用风险收益调度器动态分配计算量,在RoboTwin仿真与真实机器人任务中大幅减少去噪步数,同时保持甚至提升任务成功率。
谷歌云推出Gemini智能体,重塑企业工作方式
谷歌云推出可自主执行任务的统一AI助手Gemini agent,支持多模型选择与跨平台接入,可通过预算上限暂停token消耗以控制企业成本。
打破均匀分配的诅咒:视频扩散模型的专家们该如何分工
论文提出SplitMoE,发现标准MoE的均匀分配机制不适合视频数据,将专家拆分为语义专家和通用专家,配合原型引导路由,提升视频生成质量与训练效率,揭示了模型内在的粗到细生成规律。
Jev嘴上说“是“,心里却在说“我不知道“
论文提出Sys1Cal-v1数据集检验AI模型Jev的概率校准,发现其Choice接口存在系统性偏差,源于隐藏的"不确定"状态被强行压入二元选项,找回该状态后校准准确率大幅提升。
让AI模型自己管理聊天记录,会发生什么
论文提出Context Language Models(CLM),让AI把对话上下文变成可自由读写的文件,自主决定如何管理记忆。零样本部署即在深度研究、编程、长期任务上超越现有方法,兼具更高准确率和更低算力消耗,并支持通...
IBM与SAP联手推进企业云迁移升级
IBM Ready for SAP Solutions整合Cognitus方法论与IBM Consulting Advantage,助中端企业加速SAP云ERP迁移,并称有客户将运营周期缩短50%。
给AI装个账本:为什么聪明的模型也会在复杂任务里越问越糊涂
Q&A Q1:Omni-Decision是什么? A:Omni-Decision是一套面向全模态智能体的规划系统,核心是用一个结构化的"证据账本"取代不断膨胀的对话历史,让AI在处理视频、音频、网页等多来源信...
AI或使软件工程师生产力提升32.6%
美国国家经济研究局研究显示,2022年11月至2025年12月,AI令市场预期的软件工程生产力现值相当于永久提升32.6%,基线情形下美国GDP提升3.6%。
给电脑装个“嘴“,AI才真正学会用电脑
本文介绍HybridCUA框架,通过构建GUI与命令行混合的训练数据及CLI感知奖励机制,让AI电脑助手学会灵活切换操作方式,在OSWorld上准确率提升14.8个百分点,并展现出优秀的跨平台泛化能力。
机器人不用真人教也能学新本事,靠的是自己给自己批改作业
EVO-WAM让世界动作模型通过验证自身生成的视频动作轨迹实现自我进化,无需额外专家示范或真实环境试错,在仿真与真实机器人陌生任务上成功率均大幅提升。
我让Meta Muse帮我处理手机号问题,结果处处受阻
作者测试Meta Muse智能代理处理电话号码归属问题,发现Visible、WhitePages等网站普遍屏蔽AI机器人访问,代理多次遭遇403错误和反爬虫拦截,最终无法自主完成任务,仍需用户手动介入。
当医学影像的分割模型遇到一张陌生的胸片,它给出的答案往往漏洞百出。这不是因为模型不够聪明,而是因为它压根没见过这种图。
论文提出用提示词分歧生成的二元偏好取代昂贵的像素级标注,通过区域局部化偏好优化让开放词汇分割模型适配医学、遥感等专业领域,无需专家标注即可显著提升精度,且对噪声标签具有稳健性。
Xona商用GPS替代系统即将上线
Xona Space Systems计划本月由SpaceX发射六颗卫星,推进258颗Pulsar星座部署,提供厘米级定位授时,已融资超3亿美元。
AI写研究报告,为什么让“多个大脑“分头干活比“一个大脑“从头到尾更靠谱
美团LongCat团队提出深度研究系统LongCat-DeepResearch,通过ResearchSpec分离全局规划与章节调查,配合分层编辑机制,在DeepResearchBench等三大评测中超越同类产品,同时支持...

