Skip to main content
学术诚信ai检测指南考试

教授能检测多选题中的ChatGPT吗?实际追踪的内容

· 10 min read· NotGPT Team

教授能用检测论文的同样方式检测多选题中的ChatGPT吗?不完全能——选中的答案选项没有句子结构、词汇选择或措辞供AI文本检测器分析,因此识别AI生成段落的软件对完全由A/B/C/D选项组成的测验无用。教授和测试平台改用另一层证据:测验日志、逐题作答时间、监考录像、浏览器活动、设备和网络数据,以及答案提交前的修改模式。本指南逐一介绍这些信号实际能和不能证明什么,以及一个没有做错事的学生可能仍会显得有嫌疑的情况。

教授能检测多选题中的ChatGPT吗?

简短的答案是:教授不能像检测书面论文那样检测多选题中的ChatGPT,因为没有散文让检测工具评分。Turnitin的AI写作指标和GPTZero等工具通过测量困惑度和突发性来工作——这些是句子构造的统计特性,只在页面上有实际写作时才存在。多选题提交是一组选定的选项,不是段落,所以没有语法、词汇选择或句子节奏让这些工具运行概率评分。这个差距不意味着多选题考试不受监督。它意味着教授或测试平台可以依靠的证据完全转向答案周围的行为——每题花了多长时间、浏览器是否保持焦点、监考录像显示了什么,以及答案模式是否与班级其他学生的表现相符。

"气泡纸答题卡上的答案里没有AI检测工具可读的东西。如果我们担心多选题的分数,证据必须来自其他地方。" ——州立大学评估与测试办公室,2025年

为什么AI文本检测工具对多选答案无效?

AI文本检测工具旨在分析书面语言,而不是决策。困惑度测量给定前面的单词时每个单词的可预测性,突发性测量文档中句子长度和节奏的变化程度——这两个特性都需要首先存在一串原始句子。在第14题上选择选项C不会产生任何这样的内容。学生可以将问题输入ChatGPT,获得答案为什么是C的解释,然后点击C——由此产生的测验提交将与独立解决问题的学生的提交完全相同,因为只有字母会进入成绩簿。这与论文题不同,即使是经过大量编辑的AI草稿也会留下检测工具可以识别的统计指纹。在纯多选考试中,指纹就不存在了,这正是为什么"教授能否检测多选题中的ChatGPT"这个问题的答案来自平台和监考数据,而不是文本分析软件。

测验日志和LMS活动数据实际显示了什么?

每个主要学习管理系统——Canvas、Blackboard、Moodle、D2L——记录的关于测验尝试的内容远超大多数学生的认识,即使初看起来没有异常,讲师也可以提取这些数据。日志通常记录尝试何时开始和结束、学生在每题上花费的时间、学生在题目之间来回导航的次数,以及尝试期间浏览器窗口是否失去焦点。这些都不能告诉讲师学生特别使用了ChatGPT,但它建立了一个行为档案,当数字异常时可能看起来与无协助的尝试不一致。一个特定平台的测验日志记录的更深入细分——包括Canvas如何构造这些数据以及LockDown浏览器在其基础上添加的内容——在一个关于Canvas是否能特别检测多选题中的ChatGPT的配套指南中有详细介绍。

  1. 尝试开始和结束时间戳,加上测验花费的总时间
  2. 每题的花费时间,不仅仅是整个尝试的时间
  3. 导航事件——学生在题目之间移动的次数
  4. 焦点丧失事件,如果平台或监考工具跟踪浏览器或窗口切换
  5. 与登录会话相关的IP地址和设备信息
  6. 最终提交前所做的每个答案变更的完整修订历史

时间模式能否揭示AI辅助答案?

时间是多选考试中较为有用的信号之一,正因为AI辅助答案往往以一种即使不阅读任何文本也可测量的方式改变测验尝试的节奏。在单独窗口中查阅每题的学生通常会产生更平坦的时间曲线——题目答题时间范围相似,而不是你期望从实际解答简单题快速、难题花时间的人那里看到的自然变化。审查此类数据的讲师通常不是孤立地查看一个学生;他们是将单个尝试与整个班级的时间分布进行比较,或与该学生早期面对面考试的时间进行比较。完成时间远低于班级平均值、整个测验中每题答题时间异常均匀的尝试比简单完成早的那个吸引更多审视。快速完成本身证明很少——有些学生就是快速答题者——这就是为什么时间数据几乎总是与至少另一个信号配对才能有人提出问题。

监考软件是否能在测试中捕获ChatGPT使用?

监考工具,如带有Monitor的Respondus LockDown浏览器、Proctorio和Honorlock,不会直接检测ChatGPT——它们记录视频、音频和屏幕活动,并标记供人工审查的特定事件。常见的标记包括学生的凝视在屏幕外离开延长时间、房间里第二个人的声音或存在、可见或正在使用的电话或第二设备,以及在锁定的会话期间尝试打开新浏览器标签页或应用程序。这些标记中没有一个说"使用了ChatGPT"——它们说"这里发生了一些事情,审查者应该查看。"教师或学术诚信官员通常在上下文中审查标记的时间戳:学生在三秒内瞥一眼手机的阅读与学生在锁定的浏览器在前台闲置两分钟内在第二设备上输入完全不同。监考软件默认生成大量标记事件,其中大多数结果没有——敲门、孩子进入画面、瞥一眼墙上的时钟——这就是为什么审查步骤,而不是标记本身,是做出真正结论的地方。

"监考软件无法捕获ChatGPT。它捕获行为,然后一个人决定该行为是否意味着什么。" ——公立大学在线测试中心主任,2025年

浏览器活动和标签页切换日志揭示了什么?

锁定浏览器扩展程序专门用于关闭单选题考试中纯文本检测无法覆盖的差距。它们可以阻止学生打开新标签页、最小化考试窗口,或在尝试期间切换到另一个应用程序,许多应用程序会记录每次尝试这样做的操作,即使操作本身被阻止。一些平台还禁用测试窗口内的复制和粘贴,并记录任何与之相关的尝试键盘快捷键。一个反复尝试从锁定的考试中alt-tab出去的学生,或其浏览器在短窗口内报告多个焦点丧失事件的学生,会生成一个日志条目,教师可以与同一尝试的时间数据一起审查。这些日志是机会的代理,而不是AI使用的证明——焦点丧失事件可能意味着通知弹出、第二台监视器触发虚假检测,或学生真的试图查找某些信息。对审查重要的是它发生的频率以及它是否与来自同一尝试的其他信号相符。

  1. 被阻止或记录的打开新标签页、应用程序或浏览器窗口的尝试
  2. 在禁用该功能的测试中复制粘贴尝试
  3. 同一尝试的短跨度内重复的焦点丧失事件
  4. 在锁定的会话期间检测到连接的第二台监视器或显示器
  5. 与切换窗口或网络搜索相关的键盘快捷键

IP地址和设备指纹是否能暴露外部帮助?

网络和设备数据添加了时间和文本分析无法单独覆盖的一层。如果学生的注册设备和位置与考试尝试期间使用的设备和IP地址不匹配,该不匹配即使在说明任何单个问题如何被回答上没有任何关系也会在会话日志中显示。测试平台也会标记同一课程中的多个学生在同一考试窗口期间从同一IP地址或不寻常的相似设备指纹登录的情况,因为该模式更常与在同一房间中工作的学生相关联,而不是特别是与AI使用相关——但这是任意一种方式都会仔细查看的异常类型。VPN使用可以触发类似的标记,特别是在要求学生连接到特定校园网络以进行监考评估的机构中。与这里涵盖的每一个其他信号一样,这些数据中没有任何一个按名称识别ChatGPT。它所做的是将表现看起来足够与预期基线不同的尝试范围缩小到合理化后续对话。

答案更改模式是否会引发危险信号?

大多数测试平台会记录学生在最终提交前更改答案的每一次,包括每次更改的时间戳,在某些系统中,还包括更改前选择的选项。为大班级构建的考试诚信软件可以一次分析整个班级的该修订历史,寻找不太可能偶然发生的模式——例如一群学生在彼此几秒钟内将同一问题更改为同一答案,或一个学生的答案在测试中途暂停后立即从错误选项转移到正确选项,中间没有可见的推理。这同一类软件也用于比较学生之间的错误答案模式,因为两个独立猜测的学生往往会降落在不同的错误选项上,而两个从同一外部来源复制的学生——包括共享的ChatGPT会话——更有可能降落在相同的错误答案上。一个单一的答案更改本身意味着很少。一群异常的更改跨越多个学生,或来自同一学生的多个考试中重复的模式,是倾向于推动审查进行的。

如果教授怀疑测试中的AI使用会发生什么?

标记的多选题尝试几乎从不直接导致处罚,因为这里涵盖的任何信号都不是其自身结论性的——具有书面AI政策的教授通常应该从多个数据点构建案例,然后才能采取行动。该过程通常从对测试日志、任何监考标记以及学生的表现与其早期亲身评估工作的比较进行综合审查开始。如果审查后模式仍然看起来异常,许多教师会直接跟进学生,有时要求他们解释对特定问题的推理或完成涵盖类似材料的简短监督重做。能够对标记问题进行推理的学生通常在该阶段解决问题。未获非正式解决的案件进入正式学术诚信过程,教师通常应该在做出任何发现之前呈现完整的证据模式——而不是单一的时间异常或单一的焦点丧失事件。这种分层过程是对教授能否以任何信心检测多选题中ChatGPT使用的实际答案:很少从一个信号,但足够从多个信号对齐。

  1. 教师或测试部门审查来自同一尝试的综合信号,而不是孤立的单一标记
  2. 将该尝试与学生的表现历史以及可用的班级其他部分进行比较
  3. 后续对话或监督重做为学生解释模式提供机会
  4. 未解决的案件进入需要多于单一数据点的正式学术诚信审查
  5. 任何发现通常记录完整的证据模式,而不仅仅是原始标记

使用NotGPT检查混合格式考试的书面部分

NotGPT对纯多选题部分无能为力——没有文本要分析,没有检测器改变那个。但许多考试在同一评估中混合多选题和短答题或论文问题,这些书面部分正是真正的AI文本检测器适用的地方。如果你担心重型编辑后的短答题答案可能如何阅读,或技术解释对于你在时间压力下写的内容来说听起来不寻常的流畅,在提交前将其粘贴到NotGPT中,以查看教师的检测工具会生成的相同类型的概率评分。如果一个部分对于真正是你自己的写作来说评分过高,Humanize功能也可以以Light、Medium或Strong强度重写标记的段落。

使用NotGPT检测AI内容

87%

AI Detected

“The implementation of artificial intelligence in modern educational environments presents numerous compelling advantages that merit careful consideration…”

↓Humanize↓
12%

Looks Human

“AI in schools has real upsides worth thinking about — but the trade-offs are just as real and shouldn't be glossed over…”

即时检测AI生成的文本和图像。一键将内容人性化。