上周四,谷歌在YouTube官方账号发布了一个Gemini的交互演示视频,引发了大量网友的关注和讨论,然而热度和夸赞还没享受多久,谷歌转眼就陷入了造假风波。视频中看起来Gemini能够快速识别图像,并通过自己的理解直接做出反应。但实际上,这段演示视频并不是实时的,而是通过读取图片,再编写提示词,才让Gemini做出的回应。事后谷歌已经证实,视频确有剪辑。
“有意见”留言板
Ada:Gemini的“原生多模态”,区别于现有的“拼凑多模态”模型,即从一开始就使用多种模态(例如音频、视频和图像)训练而成。因此,Gemini可能会带来一些突破,但不要先把信任搞没了,毕竟谷歌在制作演示视频这方面有前科。
@辣腿堡不加酱:虽说谷歌视频演示的多模态能力,可能在一年内就能实现。但宣传过火,以至于让公众认为视频造假,不知是不是单纯为了博眼球,赚流量,但给公众的感受还是不太好的。
@媒体搬运工:大模型也玩大跃进?大家都不能免俗,踏实研究别浮躁,人工智能时代要务实一些!
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。