Simon Willison 的经典 LLM 测试(生成骑自行车的鹈鹕 SVG)已成为非官方标杆。研究者通过 1008 张 SVG 对比 7 个模型,发现无明显针对该基准优化的证据,但讨论揭示了 AI 实验室面临刷分诱惑。
Simon Willison 近年来用同一个提示词“生成一张骑自行车的鹈鹕 SVG”测试每个主要 LLM 版本。这个玩笑般的基准测试逐渐成为 AI 圈最知名的非正式评测之一,其结果是 Hacker News 新模型发布帖下的高赞内容。由于涉及巨额资金,人们开始担心 AI 实验室是否可能针对该测试进行刷分(pelicanmaxxing)。研究者 Dylan Castillo 为此设计了一项实验:构建 8 种动物 × 6 种交通工具的 48 个提示组合,通过 OpenRouter 调用 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro 共 7 个前沿模型,每个提示生成 3 个样本(温度 1.0),最终得到 1008 张 SVG。所有 SVG 经由渲染、LLM 评判(GPT-5.6 Luna 打分)和特征提取(Gemini 3.1 Flash-Lite 识别)三步分析。
如果某实验室专门训练了针对“鹈鹕骑自行车”的优化,理论上应在鹈鹕行或自行车列上出现异常高分。然而实验结果并未发现明显刷分迹象:鹈鹕自行车的图像质量与模型其他输出无显著差异,仅在 GLM-5.2 的某个样本中略好,但不足以证明针对性训练。该研究揭示当非正式基准影响力扩大时,AI 实验室面临的优化激励——哪怕只是微调也可能影响用户选择。文中还探讨了评估方法的局限性,所有代码已在 GitHub 开源。
原文链接: https://dylancastillo.co/posts/pelicanmaxxing.html