资讯

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

虎嗅文章·2026/9/5 11:44:39🔗 原文

📋总体概括

硅星人Pro参考开发者Simon Willison自2024年流传的「自行车鹈鹕」SVG测试传统,自行搭建了一个「你画我猜」式的模型评测基准,通过1350张生成图对新模型进行横评,结果显示GPT-6以微弱优势胜出。文章梳理了这一玩笑式测试如何演变为观察新模型能力的保留节目,甚至有人质疑模型公司是否已开始针对这类测试题做专门优化,反映出社区基准与官方跑分之外的另一种模型能力评估视角。

关键信息

  • 开发者Simon Willison自2024年起用同一道「自行车鹈鹕」题目反复测试新模型的SVG生成能力
  • 这一玩笑式测试逐渐成为每次新模型发布后社区检验能力的保留节目
  • 硅星人Pro自制「你画我猜」Benchmark,用1350张图完成本轮横评
  • 评测结果显示GPT-6以「险胜」姿态排名第一,各模型差距不大
  • 社区有人认真考察模型公司是否针对鹈鹕测试题做了专门优化,显示非官方基准的影响力

🔥犀利点评

1350张图测出来的「险胜」,比官方跑分榜单诚实得多——SVG这种多模态能力测试暴露的是模型对空间、语义和代码的联合理解,恰好是刷榜刷不出来的短板。但当一道测试题火到人人皆知,它的有效期就开始倒计时:模型公司一旦针对性优化,Benchmark就变成了应试作文。真正该担心的是,我们至今没有一套既公开又防作弊的主流多模态评测,只能靠一只鹈鹕续命。

本文由本站自动聚合,以下为原始来源:前往 虎嗅文章 阅读全文