视频无缝生成声音来了,Pika 模型可以根据视频内容生成相配的声音了。如果你有自己的想法,那么你可以给出提示,描述你想要的声音类型;或者直接让Pika根据视频内容自动生成。就是它可以根据你的画面自己生成声音,比如根据树林,生成鸟鸣,比如看到汽车,发出汽车嗡嗡的声音,比如看到烟花,会配上烟花爆竹的声音。
根据宣传来看,其声音效果高度与视频画面匹配。
“有意见”留言板
@辣腿堡不加酱:用户只需一个 prompt 或 简单的描述 就能用Sound Effects生成音效,这的确降低了视频产出的技术门槛,让更多的人能够不受技术束缚,展现自己的创意。至于对影视行业是否会造成冲击,也许会有,但对于高内涵的作品可能影响不大。正如机器翻译暂且达不到人工译者的“信”、“达”、“雅”一样,影视作品所想表现出的反讽或引发人们深思的内容,演员情绪细节的流露,都不是仅仅靠视频和音效生成软件加持就能冲击或超越的。
@媒体搬运工:生成式AI的大门打开之后就关不上了,从文字到音视频,当这些内容充斥互联网的时候,究竟是好事还是坏事呢?
好文章,需要你的鼓励
随着AI编程工具的普及,越来越多的非开发者开始尝试自己构建应用。谷歌在I/O大会上宣布,AI Studio新增功能可让用户通过提示词快速生成原生Android应用,并直接导出到手机。此外,谷歌还推出了基于Gemini的自定义小组件功能,并提出"生成式UI"概念,让手机界面根据需求实时生成。与此同时,苹果据报道也在探索通过提示词创建快捷指令的功能,手机个性化体验或将迎来新突破。
新加坡国立大学构建了首个视频隐喻理解基准ViMU,含588段视频与2352道题,测试16个主流AI模型均未超过50%,揭示AI在视频潜台词理解上的系统性短板。
麻省理工学院劳动经济学家David Autor领衔的最新研究揭示,美国战后新兴工作岗位主要由30岁以下的年轻大学毕业生获益,且多集中于城市地区。研究显示,新型工作通常伴随工资溢价,但随着相关技能普及,这一优势会逐渐消退。研究还发现,需求侧驱动对新工作创造至关重要。面对AI浪潮,Autor认为AI在医疗等领域的应用方式,将决定其究竟是创造新岗位还是取代现有工作。
浙江大学等机构联合提出PanoWorld,通过球面空间交叉注意力和57万张全景图训练数据,让AI能直接理解360度全景图的空间结构,在导航和视觉搜索任务中大幅超越现有方法。