LIVE INDEX / 最新文章
让手机变得更聪明:大型语言模型在手机自动化领域的惊人进展
2025-04-30

让手机变得更聪明:大型语言模型在手机自动化领域的惊人进展

想象一下,你只需对手机说一句"帮我订一杯拿铁送到办公室",手机就能自动打开外卖应用,找到你喜欢的咖啡店,选择拿铁,填写地址,完成支付,一气呵成地完成所有操作。这不是科幻电影中的场景,而是当前大型语言模型驱动的手机图形界面...

天工开物:天空工作室的R1V2如何让AI更会"慢思考"
2025-04-29

天工开物:天空工作室的R1V2如何让AI更会"慢思考"

你有没有注意到,人类在面对复杂问题时会放慢思考速度,仔细推敲每个步骤?而在日常简单问题上,我们则可以快速直觉地给出答案。现代AI也在模仿这种"快思考"和"慢思考"的双系统思维模式。

解锁电影的秘密:摄像机运动如何塑造你看到的每一帧画面
2025-04-29

解锁电影的秘密:摄像机运动如何塑造你看到的每一帧画面

想象一下,当你走在一条陌生的街道上,你会不自觉地移动你的头部和眼睛来感知周围的环境。你可能会抬头看看高楼,左右张望观察街道两侧的店铺,或者转身看看身后是否有车辆驶来。这种自然的观察方式实际上非常类似于电影中摄像机的运动方...

3DV-TON:基于扩散模型的纹理3D引导一致性视频试穿技术
2025-04-28

3DV-TON:基于扩散模型的纹理3D引导一致性视频试穿技术

想象一下,你是否曾经在网购衣服时犹豫不决,因为无法确定那件衣服穿在自己身上会是什么效果?虚拟试穿技术正是为解决这一问题而生。然而,传统的虚拟试穿技术往往只能处理静态图像,而在处理视频时,则会面临更大的挑战:如何确保人物运...

DyMU:为高效视觉-语言模型打造的动态合并与虚拟解合并技术
2025-04-28

DyMU:为高效视觉-语言模型打造的动态合并与虚拟解合并技术

想象你有一个超级聪明的朋友,能看懂图片并回答关于图片的问题。但这位朋友有个古怪的习惯:无论你给他看什么图片——简单如一张白纸上的小圆点,还是复杂如一整个城市街景——他都会花同样多的时间仔细研究。这听起来很奇怪,对吧?为什...