AI坐上文本裁判席,真的靠谱吗
创始人
2026-09-08 10:58:12
0

图片由AI生成

生成式AI普及之后,写作这件事变得有些微妙。过去人们问“写得好不好”,现在多了一个问题“这到底是不是人写的”?AI检测器正是在这样的需求下,进入了人们的视野。它们分析文字中的语言特征,试图判断文本更像是人写的,还是机器生成的。

美国《连线》杂志近日报道,作家米娅·巴拉德的小说《Shy Girl》曾被AI检测公司Pangram判定为78%由AI生成。但巴拉德否认使用AI写作。随后,出版商Hachette取消了这本书在美国的出版计划。

如今,Pangram、GPTZero等AI检测产品已经进入出版社、学校和科研机构。一个原本用于辅助判断的技术,正在越来越多地参与实际决策。

AI检测器正变得更准确

早期AI检测主要依赖困惑度和突发性。困惑度衡量一段文字对语言模型来说有多“意外”,如果下一个词很容易预测,困惑度通常较低。突发性则关注句子长短、结构等变化。人类写作往往长短错落、起伏转折,AI则偏爱整齐划一、千篇一律。

但这种方法漏洞很明显。一个文风严谨的学者,或者一个英语不够流利的非母语者,写出来的东西很容易被误判成AI。因此,一些高校一度停止或限制使用AI检测工具。

随着大模型的发展,以Pangram为例,它用海量人类文本和AI文本训练模型,还让AI自己生成与真实文本相似的“镜像文本”,专门挑那些容易被误判的样本反复训练。Pangram 4的技术报告显示,在它们的测试数据里,英文文本的误判率降到了0.0041%。《自然》杂志也提到,今年7月Epoch AI测试了495篇纯人类写的文章,没有发现Pangram出现误判。

不过,这些数据主要来自企业自己的测试,第三方独立评估还不够。同时,检测模型和生成模型都在快速迭代,今天表现良好的模型,明天可能就会面临新的挑战。检测器给出的数字,不能直接当作事实。

“96% AI”不等于96%由AI写成

《自然》杂志曾拿Frontiers出版社科研诚信总监埃琳娜·维卡里奥的一篇文章去作检测。维卡里奥表示,文章初稿和想法完全由自己完成,只在修改过程中让AI润色了一下,之后又经过了人工编辑。然而,Pangram旧版本将这篇文章判定为100% AI生成,升级后的Pangram 4仍给出了96% AI的比例。

但这里的“96% AI”,并不是说文章中96%的内容都是AI完成的。检测器给出的“AI比例”,与作者实际使用AI的程度,并不是一回事。

Pangram解释称,“100% AI”并不是说文章中的每一个词都是AI写的。系统会把文章切分成不同片段,分别判断这些片段更接近AI、人类还是两者混合,再根据这些判断计算整体比例。因此,“96% AI”更准确的含义是,检测器认为这篇文本具有很强的AI生成特征,而不是认定作者有96%的内容由AI完成。

今天的写作早已不是“人写”与“AI写”的二元对立。一位作者可能独立完成初稿,仅用AI修改措辞;也可能让AI生成框架,再逐段重写;还可能经过翻译、润色、人工修订等多道工序。然而,从检测器的视角看,这些参与程度完全不同的写作方式,最终产出的文本却可能呈现相似的AI特征。

检测结果本身也并非完全稳定。《自然》的测试发现,同一段文字,单独检测和放在完整文章中检测时,分数可能不一样。《连线》的测试也发现,对文本进行一些修改后,检测分数可能随之改变。

一场没有终点的“猫鼠游戏”

检测器在升级,规避检测的方法也在更新。市面上已经出现了专门的人性化改写工具,能把AI写的句子重新组织一遍,换上更自然的词,调整表达节奏,目的就是让检测器认不出来。研究显示,经过这种处理的AI文本,漏检率会明显上升。

让AI模仿某个具体作者的风格,也是一条路径。非营利研究机构Epoch AI的一项独立评估发现,当AI被要求模仿特定作者的写作风格时,部分生成文本能够绕过检测。

语言差异也增加了这种不确定性。一些非英语母语者使用AI翻译或润色后,文章反而更容易被判成AI生成。Pangram新版模型对此有所改善,但检测结果仍可能受到语言背景和文本类型影响。

生成模型和检测模型,就这么你追我赶,谁也停不下来。生成模型想方设法学着“说人话”,检测模型就拼命寻找哪里还露出马脚。检测器更新之后,新的改写工具或许又会出现。

检测器应是指南针而非判决书

对于学校、出版社和科研机构来说,检测器更适合承担“筛查”的角色。对于学校、出版社和科研机构而言,判断一篇文章是否违规使用AI,还需要结合具体的使用情况。

据《自然》杂志报道,美国癌症研究协会已经使用Pangram检查同行评议。一名审稿人因检测结果异常受到询问后,承认自己在评审意见中使用了AI。这样的案例说明,检测器确实可以帮助机构发现异常,但从“发现异常”到“确认违规”,中间仍然需要人的判断。

Pangram也建议,在处理AI学术诚信问题时,应结合草稿、笔记、修改记录和写作过程等信息,而不能只看检测分数。

检测器可以告诉人们一段文字像不像AI生成,却无法仅凭一个数字还原真实的写作过程。随着AI和检测技术继续发展,这个边界可能还会不断变化。(记者 张佳欣)

相关内容

热门资讯

搭上低空经济、AI文旅?两连板... 桂林旅游(000978)回应市场热点。9月8日,桂林旅游再度涨停,斩获2连板。当天晚间,该公司披露的...
理性看待AI检测的局限与边界 近两年,不少高校引入AIGC检测系统来审查学生的论文。为了把“AI生成疑似度”降到合格线以下,一些学...
财说| AI软件应用半年考:谁... 2026年中期业绩披露季落下帷幕。放眼AI产业生态,上游的AI基础设施和芯片盈利能力凸显,中游大模型...
Meta版“龙虾”--扎克伯格... 如果说大火的OpenClaw让极客们看到了本地AI助手的雏形,那么扎克伯格豪赌的“AI助手Muse”...
Intel Mac彻底出局!m... 快科技6月11日消息,苹果将在macOS28中正式取消Rosetta2兼容层的支持,未适配Apple...
虹桥中心揭牌、AI大赛启动、项... 制造业出海、电商经营、生产线赋能……人工智能能做什么?9月8日下午,上海湾区科创城“虹桥中心”在虹桥...
标价“卖脸”实录:90后小伙驱... 封面新闻记者张峥实习生罗薇摄影报道90后甘肃自媒体创业者王磊,驱车900公里奔赴成都“录脸”;63岁...
原创 A... 「核心提示」这个秋天,从千元机到高端轻薄本,价格正在集体上探。而这轮涨价,可能才刚刚开始。作者|高宇...
中企集中亮相2026年柏林IF... 2026年德国柏林国际消费电子展现场。余胜良/摄证券时报记者余胜良9月4日,2026年德国柏林国际消...
9月9日AI日报:AI攻破90... 昨夜今晨,AI圈炸出好几条大新闻,挑三件最重要的讲给你听。第一件,OpenAI凌晨宣布:他们的AI系...