海明威在《流动的盛宴》里写过一句很有名的话:“你只要写出一句真实的句子。写出你所知道的最真实的句子。”(“All you have to do is write one true sentence. Write the truest sentence that you know.”

在海明威看来,伟大的写作从来不是把所有东西堆在读者眼前,而是“冰山理论”——露出水面的只有八分之一,剩下八分之七的尊严、情感与生活细节,都藏在水面之下的留白里。

但在大语言模型的跑分世界里,事情往往是倒过来的。

如果你常看各类大模型基准榜单,对过去数月的Gemini 的印象大概并不算太好。在代码生成、复杂数学推理以及多步骤 Agent 任务上,Anthropic 的 Claude Opus 和 OpenAI 的新旗舰常常轮番坐庄,Gemini 迟迟不发布新的Pro模型,老是拿Flash模型的小版本升级凑数——在不少人眼中,Gemini都快要被开除“御三家”的队列了。

但在另一张榜单上,却是迥异的面目。

我说的是今年2月,硅谷知名的数据标注与前沿 AI 评测机构 Surge AI 发布的:Hemingway-bench (海明威写作基准)。Surge AI 长期为顶尖大模型实验室提供高质量的人类专家反馈与评估环境,在业内以严苛、专业的人类盲测著称。

在这份榜单的前十名里,出现了一幕让人颇感意外的奇观:Google 旗下的 Gemini 模型密密麻麻地占据了 6 个席位。从 Gemini 3.7 Flash、3.6 Flash,到 3.5 Flash 与 3.1 Pro,除了第一名被 Anthropic 新一代旗舰模型 Claude Fable 5 拿走之外,Gemini 几乎成了 Fable 之下唯一的霸榜者。

image-20260902140212747

平日里看似被压着打的 Gemini,在人类专家眼中,俨然成了文豪——尤其是便宜的Gemini 3.7 Flash,与Claude Fable 5也不过些许差异。

作家的眼睛与机器的尺子

要理解Gemini的霸榜,先得看看 Hemingway-bench 到底在测什么。

过去行业里测大模型的“创意写作”,大多依赖自动化评测,也就是所谓的 LLM-as-a-Judge。比如著名的 EQ-Bench Creative Writing,通常用一个强推理模型当作裁判,给被测文本打分。

这种裁判机制有个致命的盲区:机器无法感知“审美疲劳”

自动化裁判极度偏爱繁复的比喻、工整的对仗、高级的生僻词,以及密不透风的结构。这就导致模型迅速学会了“打分规则套利”——你让它写一篇关于高三升入大学的短文,它能一口气在五句话里塞进四个晦涩的比喻,把故事硬生生拉长到主人公人到中年离婚写书,只为了展现所谓的“叙事张力”。机器裁判给这种文本打了满分,但任何一个有正常阅读品味的人读起来,都只会觉得油腻与窒息。

Hemingway-bench 抛弃了这套自欺欺人的机器裁判。

它找来了专业编剧、诗人、演说撰稿人和资深编辑,面对 5000 多组真实写作任务进行双盲对战评审。人类评委不会花两秒钟扫一眼排版就投票,他们会读上几十分钟,专门抓那些看似华丽实则空洞的“AI套话”(AI Slop),严厉惩罚无休止的自我解释与内容膨胀,只为找出真正有语感、有同理心、懂留白的文字。

机器在数浮夸的辞藻,而作家在看水面下的八分之七。

为什么是Gemini

为什么偏偏是平时被调侃为“Agent落后”的 Gemini,在这个榜单里大放异彩?

其实并不奇怪。

翻看评委们的细分评价,Gemini 系列(尤其是 Flash 家族)展现出了一种其他巨头模型身上罕见的特质:松弛感

很多顶级模型在经过高强度的代码训练与强化学习之后,为了强化Agent能力,尤其是代码能力,患上了严重的“工程师职业病”。无论写什么故事或感谢信,它们都恨不得把前因后果、心理动机和所有逻辑漏洞在正文里交代得一清二楚,生怕读者看不明白。这种在推理任务中必不可少的防错机制,放到文学创作里就成了灾难性的居高临下与过度说教。

而 Gemini 展现出了一种难得的灵性。评测专家发现,Gemini 3.x Flash 非常擅长在严苛的风格限制下写作,并且对微观的生活细节有着惊人的捕捉力。它描写祖母做菜,会落笔在厨房午后斜照的一抹光线与油烟声,而不是长篇大论去升华亲情;它写失落,懂得让角色沉默地看着斑驳的旧照片,而不是堆砌排比句去抒情。

更耐人寻味的是,屠榜的主力大多是 Google 的 Flash 轻量模型。没有被过于沉重的思维链死死箍住,反而让它们保留了轻盈敏捷的叙事呼吸感。

演进的悖论与意外的赢家

榜单里还藏着几个耐人寻味的细节。

最典型的莫过于 Claude Opus 系列的“演进悖论”。

在自动化评测 EQ-Bench 里,新一代的 Claude Opus 5 拿下了惊人的 2104.9 分,傲视群雄。但到了海明威榜单的人类作家眼前,Opus 5 仅排在并列第 10 位(1050分),虽然名义上略高过2月发布的“老将” Opus 4.6(1046分,第13位),但优势微乎其微;而中间迭代的 Opus 4.7 与 4.8(均只有 1040 分)更是出现倒退。

在创作者社区里,许多人甚至觉得 Opus 5 的写作体感还不如 4.6。原因不难理解:Opus 5 太想当一个全能的超级大脑了,以至于写起文章来动辄长篇大论、满嘴大词与行业黑话,连写封便条都要“过度工程化”。Anthropic 真正懂文学的,其实是新发布的顶级模型Claude Fable 5(1113分,登顶第1),而曾经的旗舰 Opus 却在代码进化的同时丢掉了最初的质朴与灵气。

与之相比,OpenAI 的 GPT-5.6 Sol 展现了后来居上的韧劲,拿下第 7 名(1060分)。相比早期版本略显死板的商务腔,5.6 在叙事结构和自然表达之间找到了更好的平衡——这一进步,与我的日常使用的体感相近。

而在我们中国的大模型阵营中,也有几款交出了亮眼的成绩单。

月之暗面的 Kimi K3 拿下了 1067 分,高居全球第 6,不仅超越了 GPT-5.6 Sol 与 Opus 5,也是整个榜单中表现最亮眼的中国模型。Kimi 在长文本叙事的一致性与语境把握上非常扎实,日常与创意表达都相当耐读。

紧随其后的是智谱的 GLM-5.3,以 1050 分跻身并列前十,展现出极佳的中文行文质感;而 DeepSeek V4 Pro(1048分,第12位)同样咬紧了第一梯队。这些模型证明了一点:在脱离了英文自动化刷分套路之后,扎实的语料与语境理解依然能在国际专家的盲测中站稳脚跟。

说到底,写作从来不是算力的线性堆叠。

当所有大模型都在为了更高的逻辑基准把自己武装成严密无缝的代码机器时,Gemini 却在海明威的尺子下证明了另一件事:

写得最好看的,往往不是那个最想证明自己无所不知的模型,而是懂得何时该停笔、给真实世界留下一抹余温的那个。

本文由笔者构思,Gemini 3.7 Flash执笔,笔者微改并审定。