Skip to main content
guideai-detectionacademic-integritypolicy

人工智能写作系统定义:什么真正算数,什么不算

· 9 min read· NotGPT Team

人工智能写作系统定义听起来应该很简单,但大多数政策文件的错误在于把所有写作工具都归为一个类别。精确的定义很重要,因为它决定了拼写检查、自动完成建议还是引文生成器是否会触发与完全由人工智能起草的论文相同的规则。本文阐述了一个可行的定义,划定了与相邻工具的界限,并为教师、编辑和政策制定者提供了他们实际上可以在教学大纲或风格指南中使用的语言。

教师和编辑需要什么样的人工智能写作系统定义?

一个可行的人工智能写作系统定义看起来是这样的:一个使用生成式语言模型根据提示、大纲或部分草稿来生成新的句子、段落或完整文档的工具,而不是仅仅更正或重新格式化一个人已经写过的文本。定义特征是生成,而不是辅助。ChatGPT、Claude 和 Gemini 显然符合条件,因为用户给出指令,系统就生成了之前不存在的文本。建立在这些模型之上的工具——人工智能论文生成器、求职信撰写工具和营销文案助手——也符合条件,即使界面将底层模型隐藏在表单或模板后面。测试不是界面看起来有多精致或产品称自己什么。测试是系统是否在代表作者撰写原创句子。即使浏览器扩展程序的营销页面从未使用过"人工智能"这个词,将项目符号大纲转换为三个完成段落的扩展程序也通过了这个测试。相比之下,只在固定句子结构中填空的模板更像是邮件合并而不是写作系统,因为它没有决定句子的内容。这就是为什么一个可用的定义必须描述行为而不是列出产品名称——底层模型不断变化,但工具是否为作者撰写句子的问题并没有改变。

与日常写作工具相比,边界在哪里?

大多数混淆来自于那些坐在人工智能写作系统旁边但不符合生成阈值的工具。拼写检查工具将每个单词与字典进行比较并标记不匹配项——没有模型在撰写任何东西。语法检查工具应用规则或狭隘的模型来捕捉协议错误和标点符号,同样不会生成实质性的新句子。自动完成,无论是在手机键盘还是电子邮件客户端中,都是根据一个人已经输入的内容来预测接下来的几个单词,一个人一次接受或拒绝一个建议。引文管理器根据风格指南格式化参考文献;它对作者的论点没有意见。这些工具都不生成文档的实质,所以根据这个定义,它们都不属于人工智能写作系统的范畴,即使其中几个在内部使用机器学习。这在实际中很重要,因为这些工具中的几个确实在幕后使用统计模型——现代自动完成键盘和语法检查工具的语气建议都由机器学习驱动——政策制定者有时会从"它使用人工智能技术"推理到"它算作人工智能写作系统"。这些是不同的说法。相关的问题不是什么技术支持建议,而是工具对完成句子的贡献有多大。

  1. 拼写检查工具:根据字典更正单个单词——不是生成式
  2. 语法检查工具:标记现有文本中的规则违规——不是生成式
  3. 自动完成/预测文本:根据已输入的内容建议接下来的几个单词——狭隘生成,不是创作
  4. 引文管理器:格式化参考文献,不撰写论点或文章——不是生成式
  5. 改写工具:使用语言模型重写现有句子——生成式的,算作人工智能写作系统
  6. 人工智能起草助手(ChatGPT 风格):根据提示或大纲撰写新段落——生成式,明确是人工智能写作系统
问题不在于是否涉及机器学习——而在于系统是否在撰写写作的实质内容,还是仅仅更正作者自己的单词。

为什么改写位于灰色地带?

改写工具是任何人工智能写作系统定义中最难的情况,因为它们对一个人已经写过的文本进行操作,这使它们感觉更接近语法检查工具而不是起草助手。从技术上讲,大多数改写工具会将输入通过生成式语言模型运行,该模型重写单词选择、句子结构,有时甚至是整个段落。输出是模型生成的新文本,即使底层想法来自原始草稿。这个生成步骤就是为什么改写工具属于人工智能写作系统的一侧,与具体重写被人工智能标记文本以听起来更自然的人性化工具一起。相比之下,一个仅用同义词交换单个单词而不重新构造句子的基于规则的同义词库,更接近于语法检查工具,在其自身上不会达到生成阈值。对特定改写工具的实际测试是查看输入和输出之间发生了什么变化:如果只有单个单词移动,将其视为语法检查工具;如果句子结构、从句顺序和措辞被大幅重写,将其视为受相同规则约束的生成工具,如人工智能起草助手。某些产品通过提供"轻"和"重"改写之间的滑块来进一步模糊这一点——轻设置可能会保持接近单词替换,而重设置会生成更接近完全重写的输出,这意味着同一工具可以根据用户选择的设置位于边界的任一侧。

人工智能检测器算作人工智能写作系统吗?

不——检测器做相反的工作。人工智能检测器分析已经存在的文本,并估计它是由语言模型生成的概率,通常通过测量统计属性来实现,如困惑度(单词选择的可预测性如何)和突然性(句子长度和结构变化有多大)。检测器不写任何东西;它读取和评分。将检测器与人工智能写作系统混淆的情况在政策语言中出现得意外频繁——一个禁止人工智能工具但不区分生成和检测的教学大纲可能会让学生不确定在提交前是否使用检查器运行自己的论文本身就是违规行为。精确的定义可以让这些类别分开:生成工具生成文本,检测工具评估文本,健全的政策以不同的规则处理每一个。这一区别也影响谁被允许使用哪一类工具。一个允许学生在提交前用检测器自行检查自己的论文,同时禁止在起草过程中使用生成工具的政策是连贯的,也很常见——但前提是政策的措辞实际上将这两个类别分开,而不是对两者都使用单一的"人工智能"伞形术语。

政策制定者应该如何将人工智能写作系统定义转化为教学大纲语言?

政策语言在直接命名生成阈值而不是列出一年内就会过时的品牌名称时效果最佳。可行的条款读起来像这样:人工智能写作系统是任何使用生成式语言模型来生成、实质性地重写或改写代表作者的句子的工具,包括起草助手、改写工具和人工智能人性化工具。拼写检查、语法更正、自动完成和引文格式化被排除在外,因为它们不生成原始句子内容。这个措辞之所以可持续是因为它由功能定义,而不是产品名称,它给教师和编辑提供了一个测试,他们可以将其应用于下学期出现的任何新工具。它还避免了一个常见的失败模式:一个特别命名 ChatGPT 的政策在学生使用具有相同生成能力的不同产品的那一刻就变得无力,一个禁止"任何人工智能"的政策在有人指出文字处理程序的拼写检查在技术上与人工智能相关时就变得不可行。基于功能的措辞避免了这两个问题。

  1. 明确陈述生成阈值,而不是命名特定产品
  2. 将拼写检查、语法检查、自动完成和引文工具列为明确的排除项,以防止过度范围
  3. 将改写和人性化工具命名为明确的包含项,因为它们是最常被错误分类的类别
  4. 在同一政策文件中将生成工具的规则与检测工具的规则分开
  5. 包括披露语言,用于允许有限的人工智能协助但必须被承认的情况

课堂披露语言在实践中看起来像什么?

当课程允许一些人工智能协助时,披露语言应直接与定义相映射,而不是要求学生进行自我诊断。一个简单的披露声明可能像这样:"我使用了 [工具名称] 来 [根据我的大纲生成初稿 / 改写第 3 段 / 仅检查语法] 在本次提交中。"围绕特定功能(生成、改写或更正)来框架化披露会给教师更清晰的信号,而不是一个模糊的"使用了人工智能"复选框,它给学生一个公平的方式来区分由 ChatGPT 起草的段落与 Grammarly 拼写检查通过。审阅自由职业者或用户提交内容的编辑可以在提交表单中使用相同的结构,要求贡献者指定写作的哪个阶段涉及生成工具。围绕功能而不是模糊承认建立的披露声明也保护诚实的学生和贡献者——只使用自动完成和引文管理器的人不应该与生成了来自提示的整个草稿的人用相同的方式措辞他们的披露,基于功能的语言保持那种区别的可见,而不是把每个工具都压平成一个披露复选框。

你如何检查草稿是否超过生成阈值?

当不清楚文档是否包含人工智能生成的文本时——一个混合的草稿、一个大幅改写的提交或一个在多个会话中编辑的片段——通过独立的人工智能检测器运行它会基于文本本身给出概率估计,而不是对哪些工具被使用的猜测。这是一个概率信号,而不是确定性:检测器可以漏掉轻微编辑的人工智能文本,偶尔也可以标记不寻常但人类写的散文。审查检测器突出显示的具体句子,而不是依靠单一的总体得分,给编辑和教师提供了一个更实用的起点来与作者进行对话。NotGPT 的文本检测器在句子级别标记可能的人工智能生成的段落,这正好适用于这种混合草稿审查,其人性化功能从相反的方向说明了改写类别——展示被人工智能标记的文本如何被重写以听起来更自然。将输出视为判断的起点,而不是判决:段落上的高概率得分是询问作者他们的过程的原因,而不是违反政策本身的证明,低得分不能保证在任何阶段都没有涉及生成工具。

使用NotGPT检测AI内容

87%

AI Detected

“The implementation of artificial intelligence in modern educational environments presents numerous compelling advantages that merit careful consideration…”

↓Humanize↓
12%

Looks Human

“AI in schools has real upsides worth thinking about — but the trade-offs are just as real and shouldn't be glossed over…”

即时检测AI生成的文本和图像。一键将内容人性化。