Skip to main content
ai-detectionwritingguide

为什么AI写作这么差?稿件为什么显得平淡无力和泛泛而谈

· 8 min read· NotGPT Team

当AI写作在语法上无可挑剔、结构井然有序时,为什么它仍然这么差?作家、教师和编辑经常问这个问题,因为问题从来不是拼写或语法——而是一种难以名状的平淡感,直到你把AI稿件和人类稿件并排对比时才能真正感受到。这种差距来自于这些模型是如何训练的,以及它们优化的目标,而不是源于词汇或结构的缺乏。理解这种平淡感背后的实际机制,是修正稿件或向学生解释他们的AI辅助段落为什么会这样的第一步。

为什么AI写作这么容易预测?

大型语言模型被训练来预测给定前文后最可能出现的下一个词。这个单一的目标解释了AI文章为什么感觉不对的大部分原因。在句子的每一点,模型都会选择大量先前文本所表明最可能出现的词或短语——而不是最能捕捉特定、独特想法的词。结果是文本几乎永远不会让你惊喜,因为它的设计就不是为了这个目的。人类作家有时会选择一个意想不到的词,因为它更精确、更生动,或者这就是他们的思考方式——即使有一个更安全的同义词就在那里。以最小化预测错误为目标训练的模型没有理由做出这样的选择;根据定义,更安全的同义词在统计上是首选的。读过足够多的AI输出后,你会开始注意到同样的节奏反复出现:一个主题句,一个支撑从句,一个温和的限定词,一个整洁的结尾。这些都没有错。但都是可以预期的,而可以预期的东西正是开始读起来很差的原因。

AI写作不是因为打破规则而糟糕。它之所以糟糕,是因为它每次都遵循最可能的规则,而没有任何不太可能的选择的文章让读者的注意力无处安放。

为什么AI写作听起来这么泛泛而谈?

模型并非来自单一源——它已经根据数百万份文档讨论某个话题的方式的巨大平均值进行了训练。当你要求它解释一个概念、描述一个产品或做出论证时,它不是在回忆某个锐利的观点;它是在将关于类似主题的大量文本中在统计上常见的措辞混合成一个单一的平滑版本。这种平均化就是为什么即使每句话都单独正确,AI写作听起来仍然泛泛而谈。具体的观点、难忘的类比或略微非常规的框架会将输出拉离平均值,而模型的训练会把它推回中心。中心是安全的、广泛适用的,几乎永远不会出错——但也几乎永远不会与众不同。这就是为什么AI编写的产品描述、求职信和关于完全不同话题的论文最终听起来奇怪相似的原因:它们都被拉向同一个统计中心。

  1. 模糊的强化词而不是具体内容:用'重大影响'代替具体数字,用'许多专家同意'代替点名具体人物
  2. 可互换的例子:插图非常泛泛,可以被交换到几乎任何其他话题的论文中而不需要修改
  3. 过度平衡的框架:每个声明都立即用'然而'或'另一方面'来限定,即使作者显然有更强的观点
  4. 教科书式的定义开启段落,这对任何熟悉该话题的读者都不需要再次解释

为什么AI的过渡段落听起来这么平淡?

人类作家在思考的方式中改变观点:有时很突然,有时用一句话安静地重新框架前面的内容,有时只是开始新的段落,因为这一点显然是有关联的,不需要一个桥接词。AI生成的文本倾向于依赖一小组连接短语——而且、另外、此外、除此之外——放在几乎每个段落的开头,不管逻辑关系是否真的需要。这个习惯来自同样的可预测性问题:'另外'是一个非常安全、非常常见的方式来链接两个相关的点,所以它被不断选择。过度使用足够多的话,这些过渡词停止发挥它们的作用。读者开始跳过它们,因为他们已经学会了这个词没有传递真实信息——它是填充物,表示'这是另一个点',而不是'这个点与上一个点的关系'。效果在整篇文章中复合:段落接段落地以同样的少数几个固定连接符开头,写作开始感觉机械,即使没有单个句子是有缺陷的。

过渡词应该告诉读者两个想法之间的关系。当每个段落都以同一个开头时,它就不再有意义了。

为什么AI写作在承认不确定性方面这么差?

AI模型一次生成一个标记,没有单独的过程来检查声明在写下之前是否实际正确。输出的流畅性和输出的准确性来自完全不同的机制,流畅性是模型优化的那个。这就是为什么AI生成的写作可以陈述不正确的统计数据、错误引用名言或发明听起来可信的研究,用完全相同的自信、结构良好的语气来描述完全准确的声明。文章本身没有对冲信号表示不确定性,因为模型没有追踪它自己的不确定性,就像仔细的人类作家追踪他们的不确定性一样。一个对某事不完全确定的人通常会——有意识地或无意识地——软化声明、添加限定词或标记为需要验证的东西。模型没有等效的内部信号来依赖,所以一切都听起来同样确定。不熟悉该主题的读者无法从它的写作方式中区分一个有充分支持的声明和一个编造的声明,这正是使这个失败模式在第一次阅读时如此容易被错过的原因。

流畅和正确不是同一个属性,AI模型只被直接优化为第一个。

为什么AI写作在真实细节方面这么差?

模型从未真正做过任何事情。它已经处理了描述其他人所做、感受或观察的文本,但它没有特定周二的记忆,没有特定地方的感官记录,也没有在论证结果中的个人利益。这种缺失表现为特定性的持久差距。让模型描述困难的对话、失败的项目或小的技术错误,它会产生结构正确且情感适当的东西——但它会选择那种经历的通用版本,而不是真正特定的版本,因为它没有特定的版本可以借鉴。人类写作,即使是关于普通事物的,也往往带有小的无法解释的细节:一个具体的数字、一个奇怪的旁注、一个不服从论证但仍然真实的观察。AI草稿倾向于省略这些,因为没有生成不相关但真实细节的机制——模型产生的一切在某种意义上都服务于即时预测任务,而零散的、无目的的具体细节很少被选为最可能的下一个词。

  1. 缺少感官或情景具体内容:没有特定的气味、声音、时间或物理细节来支持一个场景
  2. 没有未解释的切线:每句话都明显地服务于论证,没有真正作家包含的小的无关旁注
  3. 圆形、泛泛的数字而不是奇怪的具体数字:'相当大的一部分'而不是'52个回复中的37个'
  4. 被命名而不是被展示的情绪:'这令人沮丧'而不是一个具体的时刻让沮丧显而易见而不需要陈述

你如何检查稿件是否有这些问题?

对平淡AI写作的大多数修复从对上述确切模式的仔细阅读开始,因为它们都不需要从零开始重写——它们需要找到并用具体版本替换泛泛版本。按部分逐一查看,并问如果删除给定句子会丢失什么;如果答案是什么都不会丢失,那么该句子可能是填充物。然后寻找写作最单一的、最不受限制的声明,并检查这件是否真的提出了它或将其隐埋在限定词中。一个短的修订通过关注这些检查会比完全重写更能修复AI风味的稿件,因为基本思想通常是好的——表面纹理是需要工作的东西。

  1. 在稿件中搜索'而且'、'另外'、'此外'和'总之'——至少删除一半,让段落无需桥接词连接
  2. 圈出每一个模糊的强化词(重大、各种、众多、许多),并用实际数字、名称或具体例子替换它
  3. 阅读每个事实声明,并标记你是否可以指出其来源——如果不能,在发布前验证或删除它
  4. 每个部分添加一个来自真实经验或研究的具体、特定细节,而不是来自'通常'发生的情况
  5. 大声朗读这件作品——所有句子都以相同节奏和权重落地是值得打破的低变化的标志
  6. 通过NotGPT的AI检测器运行稿件,查看哪些特定句子看起来最可预测,然后先修改那些

使用NotGPT检测AI内容

87%

AI Detected

“The implementation of artificial intelligence in modern educational environments presents numerous compelling advantages that merit careful consideration…”

Humanize
12%

Looks Human

“AI in schools has real upsides worth thinking about — but the trade-offs are just as real and shouldn't be glossed over…”

即时检测AI生成的文本和图像。一键将内容人性化。

相关文章

检测功能

🔍

AI文本检测

粘贴任意文本,获取带高亮片段的AI相似度概率评分。

🖼️

AI图像检测

上传图像,检测它是否由DALL-E或Midjourney等AI工具生成。

✍️

Humanize

重写AI生成文本,使其听起来自然。可选择轻度、中度或强度改写。

使用场景