面向患者的健康AI智能体评估新基准:PatientAgentBench
随着医疗AI从问答转向代替患者执行任务,PatientAgentBench应运而生。该基准专为面向患者的AI智能体设计,具备可复现性且经临床医生审核验证。它通过生成合成患者档案、临床场景及患者智能体,模拟多轮对话并由LL...
随着医疗AI从问答转向代替患者执行任务,PatientAgentBench应运而生。该基准专为面向患者的AI智能体设计,具备可复现性且经临床医生审核验证。它通过生成合成患者档案、临床场景及患者智能体,模拟多轮对话并由LL...
2026年7月27日,The Peterman Pod主持人瑞安·彼得曼(Ryan Peterman)发布了对朱迪亚·珀尔(Judea Pearl)的长篇访谈。
Linux创始人Linus Torvalds近日表态,Linux并非"反AI项目",开发者可自由选择是否使用AI工具。他指出,AI在安全扫描方面虽会增加维护者负担,但关键在于让大语言模型工具真正帮助维护者,而非带来麻烦。...
Linux之父Linus Torvalds近期表态,Linux并非反AI项目,开发者可自由选择是否使用AI工具。他指出,AI在安全扫描中虽能发现漏洞,但也给维护者带来额外负担,关键在于让大型语言模型真正辅助维护者而非增加...
AI模型与数据集托管平台Hugging Face近日披露,其内部数据集和服务凭证在一次网络攻击中遭到入侵。攻击者利用平台安全漏洞在服务器上执行恶意代码,并提升权限获取更广泛的内部系统访问权。公司已撤销并轮换被盗凭证,建议...
Hugging Face披露一起安全事件,攻击者被确认为未知自主AI代理。该代理利用数据处理管道中的两条代码执行路径,成功入侵生产系统并窃取云端凭证,共记录超1.7万次攻击事件。值得关注的是,此次攻击由AI发起,最终也由...
据Gartner最新报告,2024年全球终端用户在AI模型和平台上的支出将同比增长63%,达到640亿美元。随着AI成本上升,CIO们正加强对AI预算的审查,聚焦使用效率、成本控制和可量化成果。受智能体AI驱动,大部分模...
AI基础设施初创公司Fireworks AI宣布完成15亿美元D轮融资,投后估值达175亿美元。本轮由Atreides Management、Index Ventures和TCV联合领投,英伟达等多家机构跟投。Firew...
安全公司CrowdStrike识别出五种新型提示词注入攻击技术,对企业AI系统构成威胁。这些攻击通过欺骗大语言模型接受恶意指令来实施,包括:触发式规则注入、认知令牌抑制、算法载荷分解、特殊令牌注入,以及用户上下文数据注入...
谷歌悄然更新隐私政策,默认将用户上传的图片、音频、视频等媒体文件用于训练AI模型。这意味着你在搜索服务中产生的所有媒体数据,均可能被用于优化谷歌的大语言模型。如需保护隐私,用户须手动关闭"搜索服务历史记录"中的"保存媒体...
本文探讨澳大利亚劳工党在人工智能监管问题上的分歧,聚焦AI公司试图削弱澳大利亚版权法保护的争议。艺术创作者对此强烈抗议,认为相关修改将损害其权益;而劳工党内部在如何平衡AI产业发展与创作者权利保护之间存在明显分歧。文章通...
据Silicon Data LLM Token支出指数(SDLLMTK)显示,当前指数报1.62美元/百万Token,较5月峰值下跌20%。价格下滑原因尚不明朗:或因企业压迫供应商降价,或因部分组织遭遇AI负面影响后产生...
Coinbase旗下AI在世界杯挪威对巴西的比赛开始前,向用户推送了一条错误通知,称挪威以3-2获胜,哈兰德打进两球。而事实上,比赛因天气原因尚未开场。最终比赛结果为挪威2-1获胜,哈兰德确实打进两球,但比分有误。此事件...
随着大型语言模型(LLM)日益普及,垃圾信息和机器人内容泛滥成灾。Reddit宣布借助LLM工具应对这一问题——每日拦截2300万次垃圾浏览,捕获约2.5万条垃圾帖子和评论。今年第一季度,用户接触垃圾内容的比例较上一季度...
亚马逊宣布,其众包服务Mechanical Turk将于2026年7月30日停止接受新用户注册。现有用户可继续正常使用,AWS也将持续维护安全性,但不再引入新功能。该平台自2005年上线以来,曾是人工标注数据的重要来源,...
微软宣布成立新业务部门"Microsoft Frontier Company",初期投资25亿美元,配备6000名行业与工程专家。该部门将向企业客户派驻前线工程师(FDE),协助其构建定制化AI应用,并借助Azure云服...
Anthropic正式推出中端大语言模型Claude Sonnet 5,其编程能力在SWE-Bench Pro和Terminal-Bench 2.1两项基准测试中分别提升5.1%和13.4%。该模型具备更强自主性,能主动...
美团今日发布新一代开源大语言模型LongCat-2.0,参数量达1.6万亿,采用稀疏混合专家架构(MoE),支持100万token超长上下文窗口。该模型完全基于国产AI芯片集群训练,有效降低对英伟达GPU的依赖。美团表示...
OpenAI推出GPT-5.6系列大语言模型,包含高端Sol、中端Terra和入门级Luna三款。Sol在TerminalBench-2.1编程基准测试中得分88.8%,开启"ultra"模式后升至91.9%,超越Ant...
科技行业专家提醒IT决策者警惕AI厂商以免费Token为诱饵的营销手段,建议采用多厂商、多模型策略以避免被单一供应商锁定。Gartner分析师指出,单一AI厂商或模型难以满足企业全部需求。当前,众多AI厂商借助风险投资补...