
AI实验室在针对“鹈鹕骑单车”刷榜吗?深度解析SVG生成基准测试
本文探讨了AI领域著名的非正式基准测试——“生成一只骑自行车的鹈鹕SVG图像”。随着该测试在Hacker News等社区走红,人们开始怀疑AI实验室是否在针对该特定提示词进行优化(即“Pelicanmaxxing”)。作者Dylan Castillo通过一项包含1008个样本的实验,测试了包括GPT-5.6 Terra和Claude Sonnet 5在内的七款顶尖模型,旨在通过对比相似及差异化提示词的表现,揭示模型是否存在针对性优化的现象。
核心要点
- 非正式基准的崛起:Simon Willison提出的“鹈鹕骑单车”SVG提示词已成为衡量大模型能力的非正式风向标。
- 刷榜嫌疑(Benchmaxxing):由于该测试知名度极高,外界怀疑AI实验室可能针对该特定提示词进行了模型优化。
- 大规模实验验证:作者测试了7款前沿模型,通过8种动物与6种交通工具的组合,生成了1008个SVG样本进行对比。
- 覆盖主流模型:测试对象包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。
详细分析
从玩笑到行业基准的演变
过去几年中,Simon Willison坚持使用同一个提示词——“生成一个鹈鹕骑自行车的SVG”来测试每一个主要的大语言模型(LLM)版本。这个最初带有戏谑意味的行为,如今已演变成AI界最著名的非正式基准测试之一。在Hacker News等技术社区,每当有新模型发布,关于“鹈鹕骑单车”的生成结果往往是讨论热度最高的内容。这种极高的关注度使得该测试不仅是模型能力的体现,更成为了产品宣传的重要素材。
实验设计:识别“针对性优化”
为了验证AI实验室是否在进行所谓的“Pelicanmaxxing”(即针对鹈鹕提示词进行特定训练),作者设计了一个严谨的实验矩阵。实验不仅包含原始的“鹈鹕+自行车”组合,还引入了相似物(如火烈鸟、苍鹭)以及完全不同的组合(如鲸鱼、浣熊搭配滑板、飞机等)。通过这种方式,可以观察模型在处理与其“成名作”相似或相异的任务时,表现是否存在断层。如果模型在生成“鹈鹕骑单车”时表现完美,但在处理“火烈鸟骑单车”时表现糟糕,则极大地增加了其“刷榜”的嫌疑。
利益驱动下的技术博弈
在AI领域,动辄涉及数十亿甚至万亿美元的投入。一个强有力的基准测试结果能够显著提升用户信心和市场评价。作者指出,在这种高额利益的诱惑下,AI实验室确实存在动力去优化那些广为人知的测试案例。本次实验调用了包括GPT-5.6 Terra、Claude Sonnet 5、Grok 4.5等在内的全球顶尖模型,通过OpenRouter平台在相同的温度参数(Temperature 1.0)下生成样本,并由LLM法官进行评分,力求还原各模型在SVG生成任务上的真实泛化能力。
行业影响
该新闻反映了AI行业评价体系的一种转变。随着传统基准测试(如MMLU等)可能面临数据污染,像“鹈鹕骑单车”这类非正式、难以预测的视觉生成任务正变得越来越重要。然而,一旦非正式基准变得过于流行,它们也面临着被实验室“针对性破解”的风险。这提示行业需要更多样化、动态化的评估手段,以确保模型能力的提升是真实的泛化进步,而非针对特定提示词的机械记忆。
常见问题
问题 1:什么是“Pelicanmaxxing”?
“Pelicanmaxxing”是一个合成词,指AI实验室为了在Simon Willison著名的“鹈鹕骑单车”SVG测试中获得好评,而专门针对该提示词优化模型表现的行为,是“Benchmaxxing”(针对基准测试刷榜)的一种具体表现。
问题 2:为什么选择SVG作为测试媒介?
因为SVG(可缩放矢量图形)是纯文本代码,大语言模型可以直接生成。它不仅考验模型的代码编写能力,还考验模型对空间结构、物体形态以及如何用代码描述视觉形象的理解能力。
问题 3:这次测试涉及了哪些模型?
测试涵盖了当前最前沿的七款模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 以及 DeepSeek V4 Pro。


