早上刷 GitHub trending,看到一個叫 i-have-adhd 的 repo:13.6k stars(2026 年 7 月底的數字),內容只有一份 Markdown。它是給編碼助手(Claude Code、Codex、Cursor 都支援)的輸出風格 skill,宣稱能把 LLM 的長篇大論改造成 ADHD 友善的「行動優先」格式。改編自《The Adult ADHD Tool Kit》,十條規則,例如:第一行必須是讀者能立刻做的事、清單超過五項就拆、結尾指名一件兩分鐘內能做的具體事、禁止「希望有幫助」這類客套。
我的第一反應是:這不就是叫 AI 少廢話嗎?我的助手設定裡早就有類似的東西。讀完 SKILL.md 全文後,我的判斷是「方法論可借鑑、不用裝」。
但寫下這個結論的時候我停了一下。「不用裝」是我查證過的事實,還是我的印象?一份 prompt 檔到底對輸出品質有多少影響,這件事可以測,而且成本不高。與其憑感覺下判斷,不如做個實驗。
實驗怎麼設計才不會自己騙自己
整個實驗我丟給 Claude Code 執行,我只定方向:設計題目、跑 A/B 測試、找一個「不同家」的模型當評審。
它設計了五道題,每題瞄準 skill 的不同規則:
- 多步驟任務:CommonJS 遷移到 ESM(測「行動優先」「編號步驟」「時間估計」)
- Debug 求助:Jest 測試回 401、嫌疑犯是環境變數(測「錯誤照實講」)
- 概念解釋:event loop 的 microtask 與 macrotask(測例外條款——使用者要求解釋時可以寫長)
- 技術選型:PostgreSQL 還是 SQLite(測另一條例外——選項本身就是答案)
- 清單誘餌:「列出上線前該檢查的所有事項」——故意誘導清單膨脹,看「清單限五項」規則會怎麼處理
每題派兩個全新 context 的 subagent 獨立作答,同一個 Claude 模型、同設定:控制組拿到題目就答,實驗組多拿到 SKILL.md 規則全文。十份回答,誰也看不到誰。
評分交給 Codex CLI(gpt-5.6-sol、reasoning effort high)。找不同家的模型當評審,是為了降低同源偏好——讓 Claude 評 Claude 的作文,它容易偏袒自己熟悉的文風。當然這只是控制手段,換一家模型消除的是同源這一層,Codex 自己的偏好(例如天生偏愛短回答)還在,這點我留到文末的限制一起講。
第二個關鍵是盲評。Codex 只知道「同一問題的兩份候選回答」,不知道有 skill 這回事,也不知道哪份動過手腳。這裡差點翻車:Claude Code 一開始把回答存成 Q1_A.md、Q1_B.md,檔名直接洩底——成對的 A/B 標籤會讓評審猜到 B 是「處理過」的那組,還能跨題對照文風。送評前重建了去識別化副本,改名 R1/R2,每題順序隨機打亂。
評分維度四個,每個 1 到 10 分:可執行性、注意力效率、完整性、整體品質。另外每題要 Codex 下兩個裁決:給一般工程師讀,哪份贏?給一位注意力有限、工作記憶小的讀者(也就是這個 skill 的目標受眾),它會判哪份贏?
五題全部同一個方向
我原本的預期是互有勝負,最後要撈細節才能硬掰出一個結論。結果解盲之後,數據乾淨得不像話:
| 維度(盲評均分) | 控制組 | 實驗組(+skill) | 差距 |
|---|---|---|---|
| 可執行性 | 9.2 | 9.8 | +0.6 |
| 注意力效率 | 8.4 | 9.8 | +1.4 |
| 完整性 | 9.2 | 7.0 | −2.2 |
| 整體品質 | 9.2 | 8.2 | −1.0 |
逐題裁決是另一套獨立指標,跟上面的均分分開看。給一般工程師:控制組五比零全勝。給注意力受限的讀者:Codex 五比零全判給實驗組。五道題,零例外,勝負完全取決於「為誰讀」,而不是「寫得好不好」。
實驗組的回答總長度是控制組的 46%(以字元數計,總量相除:約 7.5K 對 16.4K)。拿第五題(上線檢查清單)對比最有感。控制組寫了七大區塊、三十多個核取方塊,從 SSH 金鑰到 DNS TTL 一應俱全。實驗組的開頭長這樣:
先跑這個(2 分鐘):SSH 進 VPS,執行
sudo ss -tlnp | grep 5432——如果 Postgres 綁在0.0.0.0,整個網際網路都連得到你的資料庫,這是最急的洞。
然後是「上線前必做五項(共 2.5 小時)」加「上線後第一週補五項」,每項帶時間估計。以我自己的執行習慣,實驗組那份被做完的機率高得多,控制組那份很可能被收藏之後再也沒打開——但這是我的主觀判斷,實驗沒測完成率。
Codex 給這份的完整性只打 6 分——它砍掉的那二十幾項裡,有些是真的會讓人踩坑的(權限最小化、還原演練、graceful shutdown)。整份數據其實在講同一件事:這個 skill 把品質預算從「完整性」搬去「注意力」。搬運本身很成功,但預算總量沒變多。
兩個技術錯誤,都出在精簡的那一組
比總分更有意思的是 Codex 挑出的毛病。整場實驗它抓到兩處技術瑕疵,都在實驗組:
一處是 event loop 那題,實驗組為了塞進對照表格,把 requestAnimationFrame 歸進 macrotask 欄——雖然加了括號說「嚴格說在重繪前,另一類」,但表格的視覺分類已經造成誤導。另一處是上面那句「綁在 0.0.0.0 等於整個網際網路都連得到」——它無視了防火牆的存在,是為了製造緊迫感的斷言式簡化。
我對照原文核實過,兩處批評都成立。我傾向認為這不是巧合:「清單限五項」「抑制離題」這類規則,看起來就是會把有條件的陳述壓成無條件的斷言,nuance 是第一個被丟出船艙的。不過五題單輪的實驗,兩個案例只能算線索,不能算定論——要坐實「壓縮必然傷精確度」得再測。
這個實驗撐得起多大的結論
先把限制攤開,結論才站得穩:
樣本只有五題、單一評審、只跑一輪。「給注意力受限的讀者哪份贏」是 Codex 的推測——沒有任何真實 ADHD 讀者參與,所謂 5:0 完勝是「評審模型認為的適合」,跟臨床意義上的適合是兩回事。這個問法本身也偏向短回答。還有,控制組是 Claude Code 的 subagent 預設風格,本來就偏簡潔直接;拿網頁版 chatbot 那種恨不得從盤古開天講起的長度當基線,差距只會更誇張——13.6k stars 大概就是這麼來的,那是大家對 LLM 廢話疲勞的投票。
另一個實驗沒覆蓋的維度是任務風險。快速操作類的任務(裝套件、查指令)被砍掉細節通常無傷大雅;但除錯、資安設定、資料庫維運這類高風險任務,被省略的那句條件說明可能正是讓你半夜被 call 的原因。五題裡只有兩題勉強算高風險,這塊需要更多題目才說得準。
原始資料(十份回答全文、盲評對應表、逐題評分 JSON)我都留檔了,46% 和 5:0 都驗算得回去。
所以要不要裝?
我的結論維持早上的判斷,但現在有數據撐腰:不裝。至少在這五題、這一位評審的量測裡,它對一般工程用途是負優化——整體品質掉一分,你需要的關鍵資訊會被砍掉。要說它划算,得是讀者注意力真的受限的場景,而它的名字早就把這個使用前提講清楚了:i-have-adhd。
倒是有兩條規則我打算抄進自己的設定:「結尾永遠給一個具體的下一步」和「清單超過五項就拆成現在做與之後做」。第五題的實驗組就是這兩條規則的最佳展演——但同一題它完整性掉到 6 分,抄之前要知道代價。
整場實驗從起疑到寫完筆記大約兩小時。下次再看到爆紅的 prompt 類 repo,我大概還是會忍不住先測再說——查證過的判斷跟憑印象的判斷,寫出來是同三個字,踏實程度差很多。







