APP下载

Sora:文生视频模型的突破与启示

2024-06-21

信息化建设 2024年3期
关键词:模态物理能力

Sora是OpenAI继文字、图像之后,在内容生成领域的又一创新,强大的视频生成和模拟能力标志着AI在多模态领域实现重大突破。Sora的视频生成不仅仅是对人类语言的理解,而且是人对AI世界规律的更深认知

2023年是属于大语言模型的一年,而2024年,以Sora为首的多模态大模型,将带领我们走向超乎想象的远方。Sora是OpenAI继文字、图像之后,在内容生成领域的又一创新,强大的视频生成和模拟能力标志着AI在多模态领域实现重大突破。

从技术原理看,Sora模型不是一次全新的底层技术创新,而是大语言模型技术的集大成者

目前,OpenAI没有公布Sora的训练细节,只在技术报告中提到Transformer(谷歌团队2017年提出的一种经典模型)、扩散模型、Patch等,这些都不是新技术。初步判断,Sora不是全新的底层大模型,而是建立在OpenAI一系列坚实的技术沉淀上,包括视觉理解Clip、Transformers模型和ChatGPT、Video Caption(DALL·E3)等,是基于“语言大模型训练思路+模型创新”的一次进步。

深度神经网络依然是Sora的基础,将视觉数据转化为统一的表示形式,运用带有Transformer框架扩散模型Diffusion,给定输入的噪声块+文本prompt,来预测原始的“干净”分块,AI从数据中学习并执行复杂的任务。同时,OpenAI引入了视觉领域的Patch,将各种不同尺寸、分辨率、长宽比、时长的视觉数据转化为统一的表示形式,极大扩展了训练样本的来源和数量,提升了丰富度。类似语言模型,经过大规模样本训练后,Sora展现出模拟现实世界某些属性的“涌现”能力。同时,根据用户喜好,Sora运用DALL·E3等“文生图”应用,修改出不同的视频风格。

Sora可生成分辨率1920×1080的视频,也可基于静止图片创建视频,使用新素材扩展现有素材。……

登录APP查看全文

猜你喜欢

模态物理能力
只因是物理
消防安全四个能力
大兴学习之风 提升履职能力
你的换位思考能力如何
我不是教物理的
基于HHT和Prony算法的电力系统低频振荡模态识别
由单个模态构造对称简支梁的抗弯刚度
多模态话语模态的协同及在外语教学中的体现