在理解、推理、数学等领域,大模型都不是肉眼可见的速度进化,而是像坐上火箭一样。最新的消息显示Anthropic升级大模型Claude3。报告说,Claude 3系列模型在推理、数学、编码、多语言理解和视觉方面,都树立了新的行业基准!其中Claude3的Opus模型,已经全面超越GPT4。特别是在复杂的推理任务上,Claude3可以说是全面吊打GPT-4。
虽然技术报告的指标可能并不能反应真实能力,但是通过数据训练和迭代,真实能力超过指标也是瞬间的事情。
“有意见”留言板
@不倒翁:大模型进化真是一天一个样,按照演示来看,Claude3进化最大的,就是推理,就是逻辑。目前初中的物理、化学和数学等理科题基本都秒解,而且准确率吊打很多学生了,关键是用不了多久,可能高中题就搞定,只要训练的足够多。
@周一见:大语言模型的技术竞争日益激烈,每一代都有显著进步。听说Claude 3的Opus模型已接近人类理解水平,希望能对话看看它能否为我们带来更加智能和高效的服务。
好文章,需要你的鼓励
Insta360推出GO 3S复古套装,将现代4K运动相机与胶片时代美学结合。套装核心仍是仅重39克的GO 3S,新增复古取景器、胶片风格滤镜、NFC定制外壳及可延长录制时长至76分钟的电池组。复古取景器模仿老式腰平相机设计,鼓励用户放慢节奏、专注构图。相机内置11种色彩预设及负片、正片等滤镜,同时保留FlowState防抖、4K拍摄及10米防水能力,面向热衷复古影像风格的年轻创作者。
FORTIS是专门测量AI代理"越权行为"的基准测试,研究发现十款顶尖模型普遍选择远超任务需要的高权限技能,端到端成功率最高仅14.3%。
谷歌近期悄然调整账户存储政策:新注册用户若未绑定手机号,免费存储空间将从原来的15GB缩减至5GB。用户需验证手机号后,方可获得完整的15GB空间,用于Gmail、Drive和Photos的共享使用。谷歌表示,此举旨在确保存储空间"每人仅限一份",有效防止滥用。有分析认为,存储硬件成本上升也是推动此次政策调整的重要原因之一。
荷兰Nebius团队提出SlimSpec,通过低秩分解压缩草稿模型LM-Head的内部表示而非裁剪词汇,在保留完整词汇表的同时将LM-Head计算时间压缩至原来的五分之一,端到端推理速度超越现有方法最高达9%。