IT之家:https://www.ithome.com/ 9 月 2 日消息,“AI 教母”李飞飞的创企 World Labs 今日发布了“ 全球首个多模态世界模型 ”—— Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。

李飞飞 World Labs phát hành mô hình thế giới đa phương thức Atlas, hỗ trợ điều khiển camera theo từng pixel để tạo video 1440p

World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。

李飞飞 World Labs phát hành mô hình thế giới đa phương thức Atlas, hỗ trợ điều khiển camera theo từng pixel để tạo video 1440p

:https://weibo.com/1706699904/Rgd1GxdIW?refer_flag=1001030103_

通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧, 实现类似“子弹时间”的拍摄效果 。

Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。

Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像 。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。

李飞飞 World Labs phát hành mô hình thế giới đa phương thức Atlas, hỗ trợ điều khiển camera theo từng pixel để tạo video 1440p
李飞飞 World Labs phát hành mô hình thế giới đa phương thức Atlas, hỗ trợ điều khiển camera theo từng pixel để tạo video 1440p
李飞飞 World Labs phát hành mô hình thế giới đa phương thức Atlas, hỗ trợ điều khiển camera theo từng pixel để tạo video 1440p

相机控制生成:Atlas 通过像素精确的相机控制从一张或多张图像生成图像和视频, 输出最长 1 分钟的 1440p 视频 。

空间重建:Atlas 能够重建从一张到数十张输入图像的真实场景。它既能从新颖视角生成图像帧,也能生成显式三维输出,优于专门用于三维重建的先进模型。

时空模拟:Atlas 通过输入视频建模空间和时间,重新构图视频以增强戏剧性视觉效果,并支持机器人的真实到模拟工作流程。

图像生成:Atlas 支持从文本生成图像和 360 度全景,它可以跟随复杂的提示,渲染文本,并生成各种视觉风格。

World Labs 官方表示,部分合作伙伴已获得 Atlas 抢先体验资格,将在未来几周内开放早期访问。

https://www.worldlabs.ai/blog/atlas :https://www.worldlabs.ai/blog/atlas