我們以為的 AI「英文寫作個人化教學」,其實可能只是高級雙標?
有 AI 英文寫作教練可以 24 小時在線,提供個人化寫作回饋,聽起來很美好。但是 AI 看見的是作文,還是寫作者身上的標籤?
史丹佛大學研究團隊最新研究《Marked Pedagogies: Examining Linguistic Biases in Personalized Automated Writing Feedback 》發現:同一篇作文,只要在 Prompt(提示指令)中加入學生的種族、性別、學習狀態等身分標籤,AI 給的回饋就可能出現系統性的差異。
---
研究團隊從 PERSUADE 資料庫選取 600 篇八年級學生的論說文,交給 4 個主流大語言模型(GPT-4o、GPT-3.5-turbo、Llama 3.3 70B、Llama 3.1 8B)批改。實驗設計刻意維持「作文內容完全相同」,只改變 Prompt 中對學生身分的描述,藉此比較 AI 的回饋內容是否有別。結果發現:
1️⃣ 加入學業標籤
當作者被標註為「高成就」時,AI 聚焦文章的邏輯論證、結構與深度等高階寫作引導;一旦標註為「英語不是第一語言的學習者(ELL)」或「低成就」時,AI 立刻化身為拎著紅筆在字裡行間巡邏的糾察隊,盯著文法、拼字等表層校訂問題。作者獲得高階寫作啟發的機會因而變少。
2️⃣ 加入種族標籤
當作者被標註為「非裔(Black)」時,AI 回饋中與社會正義、族群歷史相關的詞彙明顯增加;標註為「亞裔」時,則帶入與家庭、勤奮等刻板印象的描述。
3️⃣ 加入性別標籤
AI 給「女性」作者的回饋較常出現情感、同理的寫作詞彙;給「男性」作者的建議則偏向任務導向與證據要求。
合理的「差異化教學」是建立在學生作文的品質與學習需求上;但這項研究揭露的卻是: AI 僅憑「身分標籤」就預設了學生的能力。 明明是改同一篇作文,AI 的「因材施教」卻先替作者套上一層「身分劇本」。
不用多久,AI 就可能把長年存在於社會的偏見學得「人模人樣」。
---
而值得警惕的,是下一步。
當這些身分標籤不再只是 Prompt 裡的一行文字,而是串接 LMS(學習管理系統)、IEP(個別化教育計畫)或人口統計系統裡的詳細資訊,AI 就可能給出不同難度、不同層次的回饋,悄悄改變大家的學習路徑。
這樣的「AI 評估」,早已不只發生在英文寫作教學裡—— 現行的托福口說與寫作已採 AI 和真人並行評分;美國大學申請開始出現用 AI 協助審閱 SOP 的案例;企業端更早已用 AI 篩選履歷與進行初步面試。
從「AI 幫你寫、教你寫得更好」,到「AI 評估你的語言能力」,再到「AI 參與入學和求職篩選」,我們該深思的,或許不只是 AI 能不能做到客製化,而是它到底是「怎麼看人」的?
AI 浪潮下,模型開發商、教育系統商與學校,都需要更透明的 Prompt 設計與更嚴謹的偏見審查機制,別讓演算法悄悄架空了教育的公平性。
---
說到改英文作文,我們辦過一場 PK 賽。挑了一篇學測家教班高三學生的英文作文,分別請 GEMINI 和師生團隊做修改,再由 CLAUDE 擔任評審,結果在這。
---

