近日一項發表于《公共科學圖書館-綜合》的研究發現94%的使用ChatGPT創建的大學考試答案,不會被檢測出是由人工智能(AI)生成的,而且這些答案的得分往往比真實學生的更高。
如今,人工智能(AI)技術的興起和發展,如ChatGPT的誕生,對教育部門提出了一個根本性問題,即學校許多形式的評估,都是在沒有監考的情況下完成的,學生可能利用AI回答評估問題。尤其新冠疫情以來,對無監督的在家考試的依賴越發嚴重。如果學生使用AI作弊未被發現,那么這對整個評估方式都是個威脅。
為此,英國雷丁大學的Peter Scarfe和同事使用ChatGPT創建了雷丁大學心理學本科生學位5個模塊共63個評估問題的答案。由于學生們是在家里參加這些考試的,所以他們可以查看筆記和參考資料,甚至可能違反規定,使用AI幫助答題。
AI生成的答案和真實學生的答案一起被提交篩查,其中前者平均占總答案數的5%。負責篩查并標記的人并不知道他們檢查的答案中有來自33名假學生的。這些學生的名字也是由ChatGPT生成的。
在所有模塊問題的答案中,只有6%的AI生成答案被標記為可能不是學生自己的答案。而有一些非AI生成的模塊問題的答案則被標記存疑。
“盡管各模塊之間存在一些差異,但平均而言,AI生成的答案得分比真實學生的更高。AI提交的材料中,得分超過學生的概率為83.4%。”Scarfe說,“但當前AI還難以進行更抽象的推理和信息集成。”
研究人員表示,他們的工作是迄今同類研究中規模最大、最有力的。盡管他們只研究了雷丁大學心理學本科學位的問題,但Scarfe認為這是值得整個學術界關注的問題。
“難保其他學科領域不會有同樣的問題存在。”Scarfe說,然而從源頭上解決這一問題幾乎是不可能的。因此,必須重新考慮評估內容。
相關論文信息:https://doi.org/10.1371/journal.pone.0305354