一款视频生成AI工具正在产业界形成风暴,那OpenAI这两天发布的名为“Sora”的工具。报道称Sora突破了传统视频制作的限制,能够理解文字提示词,并通过视觉艺术的形式呈现给人眼。
从技术上看,ChatGPT是通过提示词形成一个有逻辑的完整对话,Sora是通过提示词形成一个完整的3D虚拟世界, 那么Sora的出现就是循序渐进的量变产生的质变。OpenAI员工透露说,Sora短期内不会面世。如果这两天Sora呈现的效果不是特别选出来而是平均生成水准的话,那么未来虚拟世界会有无限精彩。
“有意见”留言板
@不倒翁:视频生成AI能力给大家带来惊艳,也给科学家们带来更多的未解之谜。比如经验主义的工程化的背后原理是什么?基于涌现的预测大模型为什么实现了推理能力? RLHF(人类反馈强化学习)大模型的作用是如何什么产生的?背后的理论、规律还在摸索中,期待AI领域的牛顿、爱因斯坦的到来!
@媒体搬运工:如果说文字是对世界的理解,那么视频就是现实的复刻了,AI更准确说是OpenAI正在不断试探人类的底线,我觉得全球应该抵制OpenAI这个“邪恶组织”了。
好文章,需要你的鼓励
邻里社交应用Nextdoor推出重新设计版本,新增本地新闻、实时警报和名为"Faves"的AI功能,用于发现本地商户和地点。该应用与3500家本地出版商合作提供新闻内容,通过Samdesk和Weather.com提供天气、交通、停电等实时警报。Faves功能利用15年邻里对话数据训练的大语言模型,为用户提供本地化AI推荐服务,帮助用户找到最佳餐厅、徒步地点等本地信息。
Skywork AI推出的第二代多模态推理模型R1V2,通过创新的混合强化学习方法,成功解决了AI"慢思考"策略在视觉推理中的挑战。该模型在保持强大推理能力的同时有效控制视觉幻觉,在多项权威测试中超越同类开源模型,某些指标甚至媲美商业产品,为开源AI发展树立了新标杆。
英国生物银行完成了世界上最大规模的全身成像项目,收集了10万名志愿者的超过10亿次扫描数据,用于研究人体衰老和疾病过程。该项目历时11年,每次扫描耗时5小时,投资6200万英镑。目前已有8万人的成像数据供全球研究人员使用,剩余数据将于年底前发布。项目已开发出能预测38种常见疾病的AI工具,并在心脏病、痴呆症和癌症诊断方面取得突破。
这项由北京大学等多所高校联合完成的研究,首次对OpenAI GPT-4o的图像生成能力进行了全面评估。研究团队设计了名为GPT-ImgEval的综合测试体系,从文本转图像、图像编辑和知识驱动创作三个维度评估GPT-4o,发现其在所有测试中都显著超越现有方法。研究还通过技术分析推断GPT-4o采用了自回归与扩散相结合的混合架构,并发现其生成图像仍可被现有检测工具有效识别,为AI图像生成领域提供了重要的评估基准和技术洞察。