AI风向

【AI风向】AI监考全面崩溃致5.8万考生重考,自动化信任危机敲响警钟

墨西哥最大高校首次AI远程监考即酿成灾难:高分考生暴增5倍,统计模型显示近半数学生涉嫌作弊,最终5.8万人被迫重返考场。这不是AI不行,是"只管部署、不管验证"的工程思维出了问题。

事件回顾

今年夏天,墨西哥国立自治大学(UNAM)做了一次大胆尝试:将入学考试从线下搬到线上,让近16万考生在家通过"锁定浏览器"和AI摄像头监考软件完成考试。这是该校历史上首次完全远程化考试。

结果,成了一场教科书级别的AI部署失败案例。

UNAM的入学考试共120道选择题。根据往年数据,2021至2025年间,仅有3.5%的考生能拿到100分以上;110分以上的顶尖考生更是只有0.9%。但今年远程考试的成绩单完全变了样:100分以上的比例飙升至16.3%,110分以上达到5.5%——两项指标分别是往年的4.7倍和6.1倍。

高分井喷引发了大规模作弊质疑。UNAM紧急成立专家委员会展开调查,最终的结论令人震惊:系统性的作弊行为很可能已经发生,必须组织一场"对照考试"——所有已录取的学生,以及达到往年录取线的考生,全部回到线下考场重新考试。

受影响的考生总数约为5.8万人。而距离原定8月10日开学只剩不到一周时间。

技术方案到底哪里出了问题?

UNAM的远程考试方案看起来并不简陋。他们部署了两层防护:

第一层:Respondus锁定浏览器。根据官方说明,考试启动后,学生"无法打印、复制、访问其他网页、打开其他应用程序,网页搜索、即时通讯、浏览器最小化等数百种功能均被阻止"。

第二层:Territorium AI监考系统。通过摄像头实时监控考生,用AI算法识别替考行为、手机/耳机使用、考生离开画面等异常。系统还配置了人工监督员——每150名考生配1人,接收AI告警后再人工复核。

听上去很周全。但现实是:只有约2%的考试因"行为违规"被取消,而统计数据显示的作弊规模远超这个数字。

问题就出在"锁定浏览器"的假设上——它以为锁住了电脑就等于锁住了考生。但考生们很快就找到了绕过方案:在摄像头范围外放置第二台显示器,直接在上面使用ChatGPT等AI工具;把耳机藏在头发下面;甚至直接找人替考——反正摄像头只能看到一张脸。

墨西哥当地媒体El País的报道揭示了更细致的漏洞:考前网上已经流传大量"作弊攻略",详细指导考生如何布置房间、如何选择摄像头角度,以及如何在AI监考的眼皮底下"合法作弊"。纽约时报的后续报道也证实,"作弊技巧在考试开始前就已广泛流传"。

对AI创业者的三个核心教训

这起事件值得每一位AI产品创业者深思。它暴露的问题,远不止"技术不成熟"那么简单。

第一,对抗性场景下,静态防御永远不够

锁定浏览器和AI监考的设计,假设的是一个"守规矩的用户"模型。但考试本质上是一个对抗性场景——考生有强烈的作弊动机,而且会主动寻找系统漏洞。

这跟很多AI创业者面临的情况一模一样:你的AI客服以为用户会好好提问,结果遭遇了提示词注入攻击;你的内容审核模型以为能识别所有违规,结果用户发明了新的绕过话术。在对抗性场景中,任何静态规则都会被快速破解。你需要的是持续迭代的攻防体系,而不是"部署完就完了"的一次性方案。

第二,AI不能替代人类判断,只能辅助

UNAM的AI监考系统确实发出了告警,也配备了人工监督员。但为什么最终还是漏掉了大规模作弊?

因为AI系统给出的信号被稀释了:大量误报让监督员产生了"告警疲劳",或者系统根本就没能识别出精心设计的作弊手法。AI可以当哨兵,但不能当法官。在涉及重大利益的决策场景(入学、贷款、招聘),人类最终判断权不可被自动化替代。

第三,部署前必须有"红队测试"

UNAM的教训最核心的一条:他们没有在真实对抗环境中测试过这套系统。16万人的正式考试,就是他们的第一次实战。

这在AI产品领域是致命的。如果一个AI客服上线前没有经过对抗性测试(让专业测试人员故意绕过、误导、攻击),上线后一定被用户玩坏。AI产品的质量保证必须包含"红队"环节——找人专门扮演恶意用户,用尽一切手段突破你的防线。 只有先被自己人打穿,才能避免被用户打穿。

AI行业的共振:信任危机比技术危机更可怕

UNAM事件在Hacker News等科技社区引发了激烈讨论。一个问题被反复提起:我们正在把越来越多的关键决策交给AI,但我们对AI系统的鲁棒性测试远远不够。

这不是孤例。从美国法院的AI量刑辅助系统被质疑种族偏见,到招聘AI被发现歧视女性候选人,再到自动驾驶系统在罕见场景下的致命失误——UNAM考试事件只是AI信任危机链条上的最新一环。

对于AI创业者来说,这既是警示也是机会。那些能在产品设计中内置"对抗性测试"和"人类兜底机制"的团队,将在信任稀缺的时代获得巨大的竞争优势。 用户选择AI产品时,越来越不只看"功能多强大",而更看"出问题时谁兜底"。

行动建议

如果你正在开发面向大规模用户的AI产品,以下三点值得立刻执行:

  1. 建立红队测试流程:每周至少安排一次对抗性测试,模拟恶意用户的攻击行为,把发现的问题记录到迭代清单
  2. 设计人类兜底路径:在每个AI决策节点标记置信度,低于阈值自动升级给人工处理,绝不让AI做"最后一公里"决策
  3. 公开你的安全机制:在官网或文档中说明你的AI系统有哪些限制、已知的绕过方式、以及你如何应对——这种透明度本身就是最好的信任信号

UNAM的5.8万考生,最终会回到线下考场,在真人监考老师的注视下重新答题。但AI行业不能等到每一次"灾难"发生后才想起补漏洞。信任,建起来需要数年,摧毁只需一次事故。


AI创业 #AI监考 #产品安全 #一人公司 #技术信任