谷歌Gemini 4 Pro在AI基准测试中成绩斐然

近日,一个名为"gemini-3.8-flash"的神秘模型在大模型竞技平台Arena中崭露头角,众多盲测数据显示,这很可能是谷歌尚未推出的Gemini 4 Pro。其卓越的性能引发了AI领域的广泛关注。特别是在一次名为"机械蝴蝶"的演示中,开发者要求模型利用Three.js从头设计并渲染出复杂结构的机械蝴蝶。这一实时代码生成的挑战考验了模型的空间几何理解、光影材质渲染及多轴物理模拟能力,稍有不慎浏览器就可能崩溃。结果显示,相较于Fable 5.1 Max,Gemini 4 Pro在暗测中耗时减少了近67%。此外,另一位开发者为相同机械蝴蝶编写了添加爆炸视图、飞行模式及组件标注等交互功能的版本。在与3D手表、机器人“瓦力”等的比较中,Gemini 4 Pro在爆炸视图和组件设计上表现优异,甚至在没有要求的情况下主动增加动画和交互细节。

最引人注目的则是流出的基准测试数据,Gemini 4 Pro在多个测试中全面领跑,取得SOTA成绩。其中,在DeepSWE v1.1智能体编码任务中达到了88.7%,超越GPT-6 Astra的86.9%;而在GDPval-AA v2的真实知识工作任务中则成为唯一一个突破2000 Elo的模型,分数达到2064;在Terminal-bench 2.1终端编码能力测试中以95.3%的成绩名列第一;同样地,在OSWorld-2.0计算机操作测试中也以86.8%位居榜首。在评估Agent的多步执行能力方面的Terminal-Bench 4.0测试中,Gemini 4 Pro与此前型号Flash的差距从上代的3.2%扩大到13.9%,这表明随着任务复杂性的提升,其优势更加明显。在价格上,该模型的输入费用为每百万Token 2.25美元,输出费用为11.25美元,在顶级产品中展现出很强的竞争力。

发表评论

订阅我们的邮箱