论文里那个基础集合坍缩成一个基的bug,AI把论文变代码时总在偷懒
论文提出PaperCompiler框架,通过将论文证据编译为带溯源的仓库级规范,解决AI生成代码时算法逻辑被简化、跨文件不一致的问题,在Reference-based评测上比强基线提升13.8%。
论文提出PaperCompiler框架,通过将论文证据编译为带溯源的仓库级规范,解决AI生成代码时算法逻辑被简化、跨文件不一致的问题,在Reference-based评测上比强基线提升13.8%。
NVIDIA团队打造编程竞赛AI系统,结合数据筛选、监督微调、强化学习与GenCorrect迭代策略,在IOI 2026现场以535.4分超越人类冠军498.27分,首次实现AI在奥赛赛题上反超人类最强选手。
一篇新研究发现,顶尖代码嵌入模型面对几乎一模一样的正确与错误代码时,排名第一的准确率仅33%,91%以上的失误都撞上了精心设计的"孪生陷阱"代码。
本文介绍MULTI?IR基准和SPIN方法,揭示多模态检索系统面对开放式问题时存在的单一视角偏见,并提出通过在模型中间层注入噪声向量来低成本提升检索结果对多个视角、多学科、多媒介的覆盖能力。
DiagEvo提出一种诊断引导的自我博弈框架,让AI模型从自己失败的解题记录中提炼可复用的错误原因,并通过分层记忆结构动态指导下一轮出题,无需依赖外部人工数据即可持续提升数学与通用推理能力。
根据市场需求推进兆瓦级充电设施的规模化部署是一项复杂的系统工程,现有的验证方法和解决方案已无法应对这一挑战。在此背景下,测试与验证成为货运行业电动化、智能化转型中破解相关瓶颈的关键路径之一。
蚂蚁集团发布UI-Venus-2,覆盖手机、网页、桌面三端的通用GUI智能体。论文核心不在模型架构,而在如何用深度研究式任务生成、双层轨迹验证、多教师蒸馏解决数据可信度问题,实测多项指标超越Claude、GPT-5等顶级...
本文介绍一种解决多智能体AI系统提示词优化易崩溃问题的新方法:控制-数据流分离。通过将执行协议与任务内容分离为独立通道,实验证明该方法在推理、评审生成、保险核保等场景中实现100%协议稳定性,同时任务表现全面优于现有优化...
希腊总理米佐塔基斯赴旧金山开展招商之旅,参观特斯拉与红杉资本,并坦言各国政府尚未为AI带来的就业冲击做好准备。他支持前沿实验室关于放缓AI发展的呼吁,同时宣传希腊的数字基础设施建设、税收优惠及微软、AWS等科技巨头的数据...
英国国家健康与护理研究所(NIHR)宣布首轮4500万英镑战略基础设施合作(SIPs)资助,支持医疗研究成果落地临床应用。项目聚焦居家健康技术与降低急诊需求两大方向,单项资助600万至1500万英镑,周期3至5年。
SkyeBrowse发布Commercial、Pro及公共安全与企业三档新定价方案,按需提供8K至16K超清处理、AI平面图生成、证据链合规等功能,每模型年费从24.99美元至199美元不等。
无人机运营商Drone Solutions International获得津巴布韦民航局批准,可使用Kite Aero的KITE系统开展超视距(BVLOS)商业配送。首阶段将聚焦医疗样本与病理物流,连接区域医疗机构与中心...
半导体工程媒体圆桌会议上,Cadence、Synopsys等EDA厂商专家探讨了多智能体AI在芯片设计中的演进趋势:架构从层级式向扁平动态组合转变,物理引擎将具备独立代理能力,但100%精度要求使纯AI方案仍面临挑战,提...
挪威能源巨头Equinor在不到一年内将3LC的计算机视觉数据质量工具推进至生产阶段,覆盖碳捕捉设施巡逻机器人、海上终端检测、卫星油污监测及微化石分类四个独立团队,项目已实现现金流盈亏平衡。
LSEG风险智能调查显示,96%的香港合规负责人对筛查数据完整性有信心,但仅76%能提供个人筛查决策的审计追踪,在亚太地区垫底,约四分之一受访者表示相关证据不完整或难以提供。
OpenAI宣布成立独立数学顾问小组AGMAI,由来自斯坦福、哈佛、牛津等顶尖机构的9位数学家组成,设于普林斯顿高等研究院。该小组将就AI数学成果的评估与发布方式提供建议,首要任务是协助协调OpenAI内部模型所产生的大...
Anthropic发布Claude Opus 5.5并降价20%,输入价格降至每百万token 4美元;OpenAI随即推出GPT-6 Sol和Luna两款新模型,定价较前代减半。两款新模型在编程、自动化等基准测试中均有...
网络安全初创公司Cyera宣布从高盛获得4亿美元融资,作为6月完成的G轮融资的延伸,估值超120亿美元。公司已推出Agent Guardian和Cyera Endpoint两款产品,并以10亿美元收购Oasis Secu...