NCB獸醫小讀書會

實驗動物科學 - 基礎篇 (P205-240)

陳敬元 Jing-Yuan Chen, DVM, PhD

國家生物模式中心 (National Center for Biomodels)
國家實驗研究院 (National Institute of Applied Research)

July 7, 2026

第一部分:前言與統計視覺化迷思

為什麼需要動物實驗設計?

  • 推動醫學的關鍵:執行動物實驗的目的是希望驗證科學假說,或測試新藥與療法的效果及安全性。
  • 避免資源浪費:不準確的結果將導致錯誤結論,浪費研發資源投入開發錯誤或危險的療法。
  • 實踐 3R 精神:透過取代 (replacement)、減量 (reduction) 與精緻化 (refinement),盡可能最小化動物數量。

統計學在實驗設計中的角色

  • 統計學不單指分析工具,更包含如何觀測紀錄、數據適用性及呈現方式。
  • 客觀決策依據:提供量化的信心指標,讓科學家依據可靠的結果得出客觀結論。
  • 潛在危機:若未仔細調查所有實驗資訊,即使使用了正確的圖表與統計工具,仍可能得出錯誤結論。

案例一:降血脂藥 A 的 HDL 迷思 (1/2)

  • 情境:藥廠想檢驗新化合物 A 對降低小鼠高密度脂蛋白 (HDL) 膽固醇的效果。
  • 表面數據:單看長條圖 (Mean±SEM),藥物 A 組看似 HDL 較低,但未達統計顯著 (p = 0.191)。

HDL變化百分比(終端/基礎/100)

終端HDL數值

案例一:降血脂藥 A 的 HDL 迷思 (2/2)

  • 原因:將基礎與終末濃度改為散布圖後,發現分配到「藥物 A 組」的小鼠,其基礎 HDL 濃度原本就偏高。
  • 結論:這是因為當初隨機分組時發生了極端偏見的選擇(分配失衡),導致結論偏差。
  • 解方:若確定是由分配失衡導致,可依據基礎濃度進行隨機化處理。

Note

這張圖還是看不出對應關係

案例二:血糖變化的信號與噪音 (1/2)

  • 情境:評估藥物 A 與 B 對糖尿病小鼠血糖的影響,兩者對照組血糖約為 285 mg/dL。
  • 表面錯覺:投予藥物 A 後血糖降至 225 mg/dL;藥物 B 降至 185 mg/dL,只看平均值似乎藥物 B 更有效。

案例二:血糖變化的信號與噪音 (2/2)

  • 結論反轉:散布圖顯示藥物 B 變異極大,而藥物 A 變異極小(可能因操作穩定或遺傳背景一致)。
  • 因此藥物 A 反而具有更穩定的降血糖療效。

信噪比 (Signal-to-Noise Ratio)

  • 信號 (分子):生物效應的大小;效應越大,信噪比越大。
  • 噪音 (分母):背景變異性的干擾;變異性越小,信噪比越大。
  • 生活比喻:就像在演講時警報器響起,你可以選擇大聲說話(增加信號),或關閉警報/門窗(降低噪音)。

第二部分:假設檢定、P 值與統計檢定力

假設檢定的基本概念

  • 虛無假說 (\(H_0\)):假設實驗組與控制組的平均存活日數等測量反應並無差異。
  • 對立假說 (\(H_1\)):假設反應受到新處理的影響,兩組平均值不相等。
  • 原則:統計檢定先假設 \(H_0\) 成立;若證據不足以拒絕 \(H_0\),也不代表 \(H_0\) 一定為真。

\(p\) 值的真實意義

  • \(p\) 值是由英國統計學家 R.A. Fisher 所提出。
  • 意義:在「假定虛無假說為真」的前提下,觀察到檢定統計量得到極端值(純粹靠運氣)的機率。
  • 迷思\(p\) 值越小 (\(<0.001\)),並不代表實驗反應的效果越強。
  • ✔️ 真相\(p\) 值僅應用於判斷顯著與否的臨界值,無法直接推斷反應效果的強弱。

顯著標準 (Significance Level)

  • 顯著水準通常設定為 \(\alpha = 0.05\),作為是否拒絕虛無假說的判斷門檻。
  • \(p < 0.05\),代表在 \(H_0\) 為真的假設下,目前這麼極端或更極端的結果不太常見。
  • 因此研究者會拒絕 \(H_0\),稱為達到統計顯著。

統計判斷的兩種錯誤

拒絕 \(H_0\) (宣稱有差異) 未拒絕 \(H_0\) (未宣稱有差異)
\(H_0\) (無差異) 第一型錯誤 (Type I) 正確判斷 I
\(H_0\) (有差異) 正確判斷 II (Power) 第二型錯誤 (Type II)
  • 第一型錯誤 (Type I / 偽陽性):明明無罪的人卻被冤枉判刑。
  • 第二型錯誤 (Type II / 偽陰性):健檢沒驗出癌症標記,結果不久後員工因大腸癌過世(漏診)。

The boy cried for wolf

統計檢定力 (Statistical Power)

  • 公式Statistical Power = 1 - β (β = Type II error probability)。
  • 在樣本數與效果大小固定時,若要求降低第一型錯誤風險,條件會變嚴格,第二型錯誤風險可能增加。
  • 提高檢定力:增加動物隻數 (n, 樣本數),可降低標準誤,使抽樣分佈變窄,減少第二型錯誤 (\(\beta\))。
    • 或是,真實效果大小較大時,\(H_0\)\(H_1\) 的分佈分離更明顯,檢定力也會提高。

\(\alpha\)\(\beta\)、effect size 與 power


探索型與求證型實驗

  • 探索型 (Exploratory):測試未知因子以「建立假說」;為避免錯失機會,起初不需嚴格多重比較校正,極易產生偽陽性。
  • 求證型 (Confirmatory):驗證特定先驗假說,需妥善安排統計策略並進行校正,以降低偽陽性的機會。

案例:基因轉殖迷你豬 MRI

  • 探索階段:研究者比較基因轉殖與野生型迷你豬的大腦,利用 MRI 全面檢視是否有腦區體積變化的表現型,這是一種可能產生偽陽性的探索。
  • 求證階段:一旦探索到特定結果,就進一步設計嚴謹的求證型實驗,專門檢驗特定腦區是否受影響。

第三部分:實驗設計的實務與反應變項

實驗設計的三大目標

  1. 減少變異性 (Noise):透過設計(如區集)控制會導致變異性的干擾因子。
  2. 增加信號強度 (Signal):例如評估發炎反應時,選擇最敏感的 DBA 或 BALB/c 小鼠品系進行實驗。
  3. 減少偏差 (Bias):確保減少與對照組比較時發生已知或未知的潛在干擾。

案例三:致命的隨機偏差與區集控制

  • 錯誤示範:非隨機地把「最老」的動物放在對照組,把「最年輕」的放在處理組;結果將無法辨識是藥效還是年齡造成的差異。
  • 區集應用:在評估尼古丁刺激成癮行為 (CPP trial) 實驗中,保證 4 個處理組的環境喜好測試箱「完全一樣」,排除測試箱的偏差效應。

實驗變數的記錄

  • 紀錄變數:在規劃與執行實驗時,除了記錄「反應」,也應該記錄「體重、飼育籠位置、健康狀況、操作員」等干擾變數,協助日後除錯。
  • 選定的量測「反應 (response)」應該要有生物效應意義,並選擇能最大化信噪比的反應變項資料型態。

五種常見的結果變項型態

  • 連續型變項 (Continuous):可用連續數值測量,例如體重 7.0 g 或 7.5 g;資訊量較高,較小樣本數也可能有足夠敏感度。
  • 離散/計數型變項 (Discrete / Count):以整數計數,例如四肢關節炎評分加總 0-16;若數值範圍很大,有時可近似連續型處理。
  • 順序型變項 (Ordinal):有等級順序,但等級間距不一定相等,例如疾病輕度/中度/重度。
  • 名目型變項 (Nominal):類別之間沒有大小或順序,例如注射後不同的迫切行為表現類型。
  • 二元型變項 (Binary):只有兩種結果,例如是/否、存活/死亡;資訊量較少,通常需要較大樣本數。

案例:普拿疼對腎臟的傷害量測

  • 量測普拿疼對大鼠腎臟的影響,可採用不同方式:
    1. 連續型:量測整個腎臟切片所有受傷區域 (最耗時,資訊最多)。
    2. 順序型:針對切片評分 (輕度、中度、重度)。
    3. 二元型:只記錄切片內「有」或「沒有」傷害 (省時,但需要超大樣本數來彌補敏感度)。

沒有對照組,實驗毫無價值

  • 沒有對照組就不可能下任何結論,因為幾乎所有實驗結論都取決於與對照組的比較。
  • 陰性對照 (Negative):確保某個未知變數不會影響實驗結果,減少偽陽性。
  • 空白對照 (Vehicle):使用試驗溶劑或媒介物,確認反應非媒介物引起。

其他常見對照組

  • 陽性對照 (Positive):用來證明實驗系統有能力觀測到已知的處理效應。
  • 安慰劑對照 (Placebo):外觀或流程類似實驗處理,但不含有效成分,用來控制期待效果與非特異性處理影響。
  • 偽對照/模擬對照 (Sham):用於區分「手術創傷」與「植入醫材」的效應。
  • 對比對照 (Comparative):將新療效與傳統療法進行比較。
  • 未處理對照/原始對照 (Naive / Untreated):什麼處理都不做,確認動物基本狀態。

第四部分:單元、因子與實驗模型

實驗單元 vs 觀測單元

  • 實驗單元 (Experimental unit):實驗中能獨立接受不同處理的「最小單位」。
  • 觀測單元 (Observational unit):實驗中用來量測反應的最小單位。
  • 案例區分:若一整籠魚共用水裡的藥物,「魚缸」才是實驗單元;若從小鼠取出器官進行多個切片檢查,小鼠是實驗單元,切片為觀測單元。

效應與因子的屬性

  • 固定因子 (Fixed):結論僅限於指定的層次間。例如挑選 A 房間與 B 房間的猴子做比較,結論僅限於 A 與 B。
  • 隨機因子 (Random):從母體隨機抽樣,結論可推論至整體。例如隨機挑選 10 間房,用以推論整個動物設施的變異趨勢。

因子的交疊關係:巢套與交叉

  • 巢套因子 (Nested):一個因子的層次被包含在另一個層次之下(例如對照組專屬動物編號 6-10,這些動物不會接受別種處理)。

  • 交叉因子 (Crossed):所有處理與動物間皆能完整對應(例如每隻動物都會接受所有的處理層次)。

區集設計:先分區集,再在區集內隨機

  • 區集 (block):已知會影響結果、但不是主要研究問題的干擾因素。
  • 目的:讓每個處理組在每個區集內都有代表,避免處理效果和區集效果混在一起。
操作日期 錯誤安排 區集設計
Day 1 全部對照組 對照、低劑量、高劑量
Day 2 全部低劑量 對照、低劑量、高劑量
Day 3 全部高劑量 對照、低劑量、高劑量

劑量-反應設計:不是只比較有沒有差

  • 劑量-反應設計 (Dose-response):建立測試物質在不同劑量下產生的線性或非線性反應關係。
  • 重點:用多個劑量組觀察反應趨勢、平台效應或毒性閾值。

Vehicle

Low dose

Medium dose

High dose

反應趨勢:無變化 → 逐漸上升 → 平台效應/毒性閾值

實驗設計類型:遞增與重複量測

  • 劑量遞增設計 (Dose-escalating):通常非隨機,動物依序接受由低到高的劑量測試 [32, 33]。
  • 重複量測設計 (Repeated measures):在同一實驗單元的不同時間點重複量測,時間因子無法隨機分派。
  • 實務上往往混合多種設計 (例如:區集交叉設計 Blocked crossover design) 以應對複雜限制。

重複量測動物:先判斷資料結構

同一隻動物產生多筆資料時,先問三個問題:

A. 重複在哪裡?

時間點、樣本、部位,還是多個 outcome?

B. 處理在哪一層?

動物間、動物內,或兩者都有?

C. 順序能隨機嗎?

可隨機為 crossover;不可隨機常見於 dose-escalation。

重點:不要把同一隻動物內的多筆資料,誤當成彼此獨立的多隻動物。

同一隻動物有多筆資料:重複在哪裡?

  1. 重複量測 (Repeated measures):同一隻動物在不同時間點或條件下反覆量測。
    例:每隻小鼠在 day 0、7、14、21 量體重或血糖。

  2. 動物內樣本/部位巢套 (Samples nested within animal):多個樣本來自同一隻動物,因此彼此不獨立。
    例:每隻動物取 3 個組織切片、數個視野,或多個細胞樣本。

  3. 多個 outcome:同一隻動物同時量多種結果變項。
    例:體重、器官重量、血液生化值、組織評分。

處理放在動物體內不同位置:處理在哪一層?

當處理是在同一隻動物的不同部位進行時,設計層級會改變:

  1. 動物作為區集 (Animal as block)
  • 同一隻動物內的不同位置接受不同處理。
  • 例:同一隻動物背部不同皮膚區域,隨機塗抹 vehicle、低劑量、高劑量藥物。
  1. 裂區設計 (Split-plot design)
  • 有些因子在「動物間」分配,有些因子在「動物內」分配。
  • 例:兔子分成不同犧牲時間點;每隻兔子體內再隨機植入不同醫材。

同一動物跨時間接受處理:順序能隨機嗎?

  1. 交叉設計 (Crossover design)
  • 同一隻動物在不同期間接受不同處理,且順序可隨機安排。
  • 例:每隻動物依隨機順序接受不同飼料或環境條件,中間設 washout period。
  1. 劑量遞增設計 (Dose-escalation)
  • 同一隻動物隨時間接受不同劑量,但順序通常不能隨機。
  • 例:毒性或安全性試驗中,劑量由低到高逐步增加。

總結:優秀實驗設計的 5 大特徵

  1. 減少系統性誤差:減少處理的偏差,不用擔心任何非預期的干擾對實驗結果造成影響。
  2. 增加實驗結論的適用範圍:例如同時採用雌性和雄性動物,不僅限單一性別,增加結論的普適性。
  3. 簡潔有力:越直觀簡潔越好,除非必要,否則不要納入過多變數導致複雜化。
  4. 分析方法明確:在規劃實驗的階段,就該完成並確定好資料的統計方式,不該得到數據後才決定。
  5. 對實驗變異性的估測可靠:如果能有效評估並且減低實驗數據的變異性,我們就可以減少動物的使用量,完全符合 3R 的實驗精神!

Thank you!