离谱!最新研究:61%中国人写的英语论文 会被ChatGPT检测器判为AI生成的
时间:2023-05-05 10:56:34来源:凤凰网

ChatGPT火了以后,用法是真多。


(资料图)

有人拿来寻求人生建议,有人干脆当搜索引擎用,还有人拿来写论文。

论文...可不兴写啊。

美国部分大学已经明令禁止学生使用ChatGPT写作业,还开发了一堆软件来鉴别,判断学生上交的论文是不是GPT生成的。

这里就出了个问题。

有人论文本来就写的烂,判断文本的AI以为是同行写的。

更搞的是,中国人写的英文论文被AI判断为AI生成的概率高达61%。

这....这这什么意思?气抖冷!

非母语者不配?

目前,生成式语言模型发展迅速,确实给数字通信带来了巨大进步。

但滥用真的不少。

虽说研究人员已经提出了不少检测方法来区分AI和人类生成的内容,但这些检测方法的公平性和稳定性仍然亟待提高。

为此,研究人员使用母语为英语和母语不为英语的作者写的东西评估了几个广泛使用的GPT检测器的性能。

研究结果显示,这些检测器始终将非母语者写作的样本错误地判定为AI生成的,而母语写作样本则基本能被准确地识别。

此外,研究人员还证明了,用一些简单的策略就可以减轻这种偏见,还能有效地绕过GPT检测器。

这说明什么?这说明GPT检测器就看不上语言表达水平不咋地的作者,多叫人生气。

不禁联想到那款判断AI还是真人的游戏,如果对面是真人但你猜是AI,系统就会说,「对方可能会觉得你冒犯了。」

不够复杂=AI生成?

研究人员从一个中国的教育论坛上获取了91篇托福作文,又从美国Hewlett基金会的数据集中摘取了88篇美国八年级学生写的作文,用来检测7个被大量使用的GPT检测器。

图表中的百分比表示「误判」的比例。即,是由人写的,但检测软件认为是AI生成的。

可以看到数据非常悬殊。

七个检测器中,美国八年级学生写的作文被误判的概率最高才12%,还有两个零误判的GPT。

中国论坛上的托福作文被误判的概率基本全部过半,最高误判概率可达76%。

91篇托福作文中的18篇被所有7个GPT检测器一致认为是AI生成的,而91篇中有89篇,都至少被一个GPT检测器误判。

从上图中我们可以看出,被所有7个GPT误判的托福作文在复杂度(Complexity)上明显低于其它论文。

这就印证了开头的那个结论——GPT检测器会对那些语言表达能力有限的作者有一定偏见。

因此,研究人员认为,GPT检测器应该多看点儿非母语者写的文章,样本多了,才能消除偏见。

接下来,研究人员把非母语者写的托福作文扔到了ChatGPT里,丰富一下语言,模仿母语者的用词习惯。

同时作为对照组,把美国八年级小孩儿写的作文也扔到了ChatGPT里,把语言简化了一下,模仿非母语者的写作特点。下图就是修正后的新判定结果。

我们可以发现,情况来了个大掉个儿,丰富了语言的托福作文错判率直线下降,低至3%,最高也不过19%。不像之前基本全部过半的错判率。

与之相反,八年级小孩儿写的作文的错判率直线上升,甚至还有一个GPT检测器的错判率高达99%,基本全错。

因为,文章复杂度这个变量出现了变化。

这里研究人员就得出了一个结论,非母语者写的东西不地道,复杂度低,容易被错判。

这也就导向了一个技术问题,同时也是一个价值问题。以复杂度来判定AI还是人类是作者,是否合理、全面、严谨。

结果显然不是。

以复杂度为判断标准的情况下,非母语者吃了大亏,因为,他们是非母语者(废话)。

AI润色=人类写的??

研究者认为,加强语言多样性不仅可以减轻对非母语者的偏见,还能让GPT生成的内容绕过GPT检测器。

为了证明这个观点,研究人员选取了2022-2023年间美国大学申请的入学论文题目,输入到ChatGPT-3.5里,一共生成了31篇假论文。

GPT检测器一开始还挺有效,但是第二轮就不行了。这是因为,在第二轮中,研究人员把这些论文又扔到ChatGPT里润色了一下,用一些文学性的语言提升了文本质量。

这样一来,GPT检测器的准确度就从100%直降到了0%。如下图:

经过润色的文章复杂度相应也上升了。

与此同时,研究人员又用了斯坦福大学145个期末项目报告的题目,让ChatGPT生成摘要。

摘要经过润色以后,检测器判断的准确性继续下降。

研究者再次得出结论,润色过的文章很容易被误判,都是AI生成的,两轮就是比一轮强。

GPT检测器?还是欠练

言而总之,总而言之,各种GPT检测器好像还是没能抓住AI生成和人类写作之间最本质的区别。

人的写作也分三六九等,仅靠复杂度判断,不甚合理。

抛开偏见因素不谈,技术本身也亟待改进。

标签:

最新
  • 离谱!最新研究:61%中国人写的英语论文 会被ChatGPT检测器判为AI生成的

    ChatGPT火了以后,用法是真多。有人拿来寻求人生建议,有人干脆当搜索引擎用,还有人拿来写论文。论文 可

  • 乌克兰空军承认在基辅上空击落了自家无人机……_天天看点

    中新网5月5日电据法新社报道,当地时间4日,乌克兰空军表示,在首都基辅发生一系列爆炸后,乌方击落了一架

  • 曹曼|中国城市环境卫生协会智慧环卫专业委员会 主任

    嘉宾介绍曹曼中国城市环境卫生协会智慧环卫专业委员会主任北京大学环境社会发展学博士、Eiiplat环境产业互

  • 劳动仲裁庭审笔录可以复印吗?劳动仲裁裁决书下来后如何上诉?

    劳动仲裁庭审笔录可以复印吗?1、劳动仲裁庭审笔录可以复印,只要不涉及国家密秘、个人隐私的材料应该都

  • 三防灯具是哪三防 如何选购电灯?

    一、三防灯具是哪三防三防灯具的三防是指防腐、防水和防尘。在一些工作环境比较差的地方,通常都会装上

  • 房屋中介是什么意思?房屋中介的佣金是怎么算的?

    房屋中介是什么意思?房屋中介,又称房地产中介,是为消费市场提供房地产评估、经纪、咨询等服务的机构。

  • 常见的抗氧化的食物有哪些?抗氧化面膜的使用方法

    常见的抗氧化的食物现在抗氧化的食物非常多,能够对抗老化火力最强的就是西红柿了,老化火力最强的就是

  • 怎么做酿豆角?酿豆角怎么圈起来?

    怎么做酿豆角将猪肉剁成泥,倒入料酒,加入酱油和盐拌匀;将提前用温水泡好的葱姜花椒水倒入肉馅中,并一

  • 建行银行卡被冻结原因有哪些?建行银行卡的有效期怎么看?

    建行银行卡被冻结原因有哪些?【1】如果是信用卡被冻结,可能是信用卡出现过异常交易,如恶意套现、伪造

  • 老年斑的形成原因是什么?怎样预防老年斑?

    老年斑的形成原因是什么老年斑的形成原因主要是由于体内代谢产生的一种游离基的物质所引起的,游离基又

  • 硬屏是什么材质?硬屏的概念定义详细介绍

    硬屏硬屏(IPS)是指:屏幕机身像素为全像素鱼鳞,方向朝左,俗称人字状,硬屏硬(触摸无水纹)是由液晶屏的

  • 春晚没有贾玲张小斐为什么?贾玲怎么了最近?

    春晚没有贾玲张小斐为什么?今年,贾玲和张小斐都没有出现在春晚,一方面是因为受到新冠肺炎疫情的影响,安

  • 苔藓植物是一群小型的高等植物?藻苔属植物有啥?

    苔藓植物是一群小型的高等植物苔藓植物是一群小型的高等植物,没有真根和维管组织的分化,多生于阴湿环

  • 淘宝寄空包给卖家会怎么样?淘宝发空包裹的处罚规则是什么?

    淘宝寄空包给卖家会怎么样?淘宝购物收到空包裹建议直接联系商家处理退款事宜或者是重新核对订单号后补发

  • 建行怎么解绑之前绑定的手机?建行换手机了怎么强认证?

    建行手机银行换手机了怎么重新绑定?建设银行手机换手机了要重新绑定手机设备需要用户登录之前的手机设备

  • 旅游
    • 世界看点:什么是红筹股?红筹股的划分是怎么界定的?

    • 信息:什么是st股票?st股票有哪些风险?

    • 世界速讯:股票孕线代表什么?孕线的使用注意事项有哪些?

    • 港股开市价收市价怎么算?收市竞价交易时段是什么?