一款视频生成AI工具正在产业界形成风暴,那OpenAI这两天发布的名为“Sora”的工具。报道称Sora突破了传统视频制作的限制,能够理解文字提示词,并通过视觉艺术的形式呈现给人眼。
从技术上看,ChatGPT是通过提示词形成一个有逻辑的完整对话,Sora是通过提示词形成一个完整的3D虚拟世界, 那么Sora的出现就是循序渐进的量变产生的质变。OpenAI员工透露说,Sora短期内不会面世。如果这两天Sora呈现的效果不是特别选出来而是平均生成水准的话,那么未来虚拟世界会有无限精彩。
“有意见”留言板
@不倒翁:视频生成AI能力给大家带来惊艳,也给科学家们带来更多的未解之谜。比如经验主义的工程化的背后原理是什么?基于涌现的预测大模型为什么实现了推理能力? RLHF(人类反馈强化学习)大模型的作用是如何什么产生的?背后的理论、规律还在摸索中,期待AI领域的牛顿、爱因斯坦的到来!
@媒体搬运工:如果说文字是对世界的理解,那么视频就是现实的复刻了,AI更准确说是OpenAI正在不断试探人类的底线,我觉得全球应该抵制OpenAI这个“邪恶组织”了。
好文章,需要你的鼓励
AMD 最近推出了第二代 AMD Versal Premium MoP(Memory on Package,封装上内存)自适应SoC。
香港大学与字节跳动研究团队提出"桥接动作"概念,通过只学习人类手腕的平移轨迹(丢弃噪声大且易误导机器人的旋转信息),实现从人类操作视频向双臂机器人的高效技能迁移。
ProMSA是由清华大学与OPPO联合提出的视觉问答智能体,通过自适应切换图像和文字检索工具、多轮渐进式搜索,在E-VQA和InfoSeek上超越现有方法。