AI不会消灭搜索,谷歌CEO皮查伊访谈:人形机器人的GPT时刻还有3年,DeepSeek改变了一些人的预期,电力是模型的终极瓶颈
在#谷歌 I/O大会前期,放出一期谷歌CEO的深度访谈,应该是再合适不过了。
TRAIL:智能助手工作流程的追踪推理与问题定位
想象一下,你拥有一个智能助理,它可以为你安排日程、搜索信息、甚至编写代码。这些助理越来越像是我们生活和工作的小伙伴,而不仅仅是简单的问答工具。它们可以操作各种工具,在不确定的环境中自主导航,有时甚至几乎不需要人类监督。这...
音频生成加速革命:Stability AI团队突破毫秒级文本转音频技术
你是否曾等待过AI生成一段音频?不管是想要一段背景音乐、声音效果还是环境音,传统的文本到音频AI模型就像一位才华横溢但动作极其缓慢的音乐家—创作出色,但要花上好几分钟甚至更长时间才能完成一段短小的音频。
MiniMax 突破语音合成极限:全新 MiniMax-Speech 技术让 AI 说话更像真人
当我们使用导航应用听取路线指引,或者让数字助手朗读新闻时,我们听到的AI语音正在变得越来越自然,但仍然存在明显的局限性。传统的语音合成技术往往需要大量特定说话者的录音样本才能生成接近自然的语音,而且在切换到不同说话者、不...
让AI更懂"听话":复旦大学团队开创多维度约束框架,大幅提升大语言模型的指令遵循能力
想象一下,你有一个非常聪明的助手,但这个助手有时会按照自己的想法行动,而不是严格遵循你的指示。在人工智能领域,这就是我们所说的"指令遵循"问题。
用游戏测试人工智能:伯克利团队的"生成游戏测试台"如何衡量AI的通用智能
想象一下,你在考试前记住了所有可能的问题和答案。当考试来临时,你看似表现优秀,但实际上只是在背诵,而非真正理解。当前的大语言模型(如ChatGPT)也面临类似问题——它们在很多传统测试中表现出色,但这真的代表它们具备了通...
"让视觉遇见理性":模型融合让AI同时具备视觉感知与逻辑推理能力
想象一下,你在阅读一份复杂的科学报告,里面充满了图表和数据。作为人类,你能够轻松地看懂这些视觉内容,并且进行复杂的思考和推理。但对于人工智能来说,这却是一个巨大的挑战。
如何用病毒传播打造一个爆款产品?连续创业者Nikita揭秘:零用户启动能在苹果App stroe拿第一,但在大厂很难孵化新创意
在模型时代,谁都能通过Vibe Coding,也就是AI编码的方式做产品了。但是,把产品做出来很容易,把产品推广出去让人用就很难。
DanceGRPO:一场视觉生成领域的"舞蹈革命"
生成式AI的世界近年来经历了翻天覆地的变化。特别是在图像和视频生成领域,扩散模型(diffusion models)和整流流模型(rectified flows)的出现,极大地提升了AI生成内容的质量和多样性。这些模型就...
Step1X-3D:迈向高保真度可控的三维资产生成新时代
如果把生成式AI的发展比作一场赛跑,那么文本、图像、音频和视频生成已经跑在了前头,而3D内容生成却明显落后,还远未达到可投入生产的成熟度。为什么会出现这种情况呢?研究团队通过深入分析,发现了三个关键瓶颈。
从同伴中学习:如何改进AI推理模型的自我纠错能力
想象一下,你刚开始解一道复杂的数学题,但在开头就走错了路。你会怎么做?大多数人可能会陷入对错误思路的执着,越走越偏。这个现象在人工智能中也存在,研究团队称之为"前缀主导陷阱"。
小米MiMo模型:如何从预训练到后训练全面激发大语言模型的推理潜力
在人工智能领域,我们经常看到像OpenAI、DeepSeek和Anthropic这样的公司推出强大的推理型大语言模型,它们能够解决复杂的数学问题和生成高质量的代码。然而,这些模型通常体积庞大,参数量动辄达到320亿甚至更...
统一连续生成模型:让AI图像生成更快更好
想象一下,如果AI绘画是一门艺术,那么现在有两大流派:一种是"多步流派",它像一位谨慎的画家,需要从模糊草图逐步细化,通常需要数十甚至上千步才能完成一幅精美画作;另一种是"少步流派",它如同天才速写师,只需几笔就能勾勒出...
REFINE-AF:通过自我生成指令和自动反馈强化学习让语言模型更听话
想象一下,你刚买了一只聪明的小狗,它天生就有很强的学习能力,但却不理解人类的指令。虽然它能够模仿其他狗的行为,甚至能自己学会一些技能,但当你说"坐下"或"握手"时,它却一脸茫然。这就是大型语言模型(LLM)的初始状态——...
冯诺依曼架构该退休了,沙特IT部长斯坦福大学讲座:AI基建如何避免“建成即落后”,两千兆瓦算力中心难在哪?三种AI模式的典型场景
今天大家看到的这期内容比较特殊,谈的不是一家公司的AI战略,而是一个国家的技术思路。内容来自沙特阿拉伯通信与信息技术部长阿卜杜拉·阿勒斯瓦哈(Abdullah bin Amer Alswaha)今年春天在斯坦福大学CS1...
点云配准新突破:斯特拉斯堡大学研究团队通过自编码器潜在空间优化实现多视图点云配准
想象一下,你有几张同一个物体从不同角度拍摄的照片,现在你想将它们精确地拼合起来,重建这个物体的完整3D模型。这基本上就是点云配准要解决的问题。点云是由三维空间中的点组成的数据集,每个点都有其x、y、z坐标。当我们从不同视...
GPT-4o在图像修复领域的初探:技术突破与现实应用的平衡之道
想象一下,如果我们把传统的人工智能模型比作专业运动员,那么像GPT-4o这样的多模态大型语言模型就相当于全能型运动员。传统的AI模型可能只擅长一种特定技能(比如短跑或游泳),而GPT-4o则可以同时理解文字和图像,并且能...
一块屏幕控制所有机器人:香港大学与OpenDriveLab推出的UniVLA让机器人学会在任何环境中行动
想象一下,你去到一个陌生的国家,那里的人们说着你完全不懂的语言。你会感到无所适从,对吧?在机器人世界中也存在类似的问题。不同种类的机器人就像来自不同国家的人,它们有自己特定的"语言"(动作方式)和"视角"(观察环境的方式...
大语言模型懂公共健康吗?英国卫生安全局评测模型对公共健康信息的理解能力
想象一下这个场景:一位刚从国外旅行回来的人出现了轻微发热和腹痛症状,担心可能感染了某种传染病。深夜时分,医院和诊所都已关门,这位患者拿起手机,向ChatGPT询问:"根据英国卫生部门的建议,我应该怎么办?"




















