一项创意写作基准测试近期由Vulsar AI发布,评估了各类大语言模型与业余及专业人类写手的表现对比。随着人工智能的普及,多份报告提到,涉及写作各领域的职业正面临被更强大的人工智能模型取代的风险。然而,基于475个提示词,这项新基准测试显示,只有前沿模型才能在这方面超越人类,而且超越的也只是业余写手,而非专业写手。

Human-writers-vs-AI.jpeg

GPT 6 Astra登顶“综合”排行榜,略微胜过业余人类写手。Vulsar AI开展的这项基准测试评估了大语言模型在长篇生成测试中的表现。提交内容使用了一个基于人类偏好数据微调的奖励模型,以预测读者的整体偏好。根据下方截图中的排行榜,GPT 6 Astra以87.8%的预测胜率领先,略胜人类写手的86.6%预测胜率。不过,业余人类写手与专业人类写手之间的技能差距依然巨大。

虽然测试确实表明,像GPT 6 Astra这样的前沿模型已经超越了业余写手,但专业写手在单独评估时得分仍然明显更高。至于第三名,OpenAI的GPT 5.6 Sol获得了77.6%的预测胜率,而Anthropic的Claude Fable 5.1则取得了70.3%的预测胜率。然而,一旦离开数万亿参数级别的AI模型,得分便出现大幅下滑。

例如,Claude Opus 5、Kimi K3、Grok 4.6等模型落入50%–65%区间,表明这些高知名度模型与人类基线确实存在局限。参数密度更低的模型表现更差,Qwen3.8-27B等热门大语言模型仅达到23.2%,DeepSeek V4.1 Flash为19.8%,而Gemma 4 26B以仅10.9%的得分垫底。

在token生成方面,人类写手在每个提示词下的产出最高,达到2,592个token,其次是GPT 6 Astra等模型,为1,537个token,Claude Fable 5.1为2,114个token。Reddit上的讨论揭示了较小模型的一个痛苦局限:它们在多章节提示中往往失去连贯性,输出重复短语,这正是人类写手在这方面被认为更胜一筹的原因。

人类写手不仅能维持复杂的叙事,其即兴思维还使他们能够随时改变风格和产出速度。不过,我们还要多久才会面对几乎能复制专业写手所成之事的AI大语言模型?那将是另一场争论了。


文章标签: #AI写作 #基准测试 #大语言模型 #创意写作 #人类写手
菠萝老师先生

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。