DAC 要解決的問題可以一句話講完:把一串整數,變成一條隨時間連續變化的電壓,且波形與原始的頻寬受限訊號一致。 困難之處在於「一致」的標準極高——16-bit 要求每一階都準到滿刻度的十萬分之一以內,24-bit 更是天方夜譚。

工程上只有兩條路能達到這個精度:把元件做得夠準(R-2R),或用時間換精度,讓誤差在平均中抵消(delta-sigma)。整個 DAC 架構之爭的分歧就在這裡,而不在「哪種聲音好聽」。


訊號在 DAC 內部經過什麼

一台現代 DAC 的內部順序大致是:

數位輸入 → 介面接收/重新計時 → 數位濾波器(內插 oversampling)
        → 調變器(noise shaping,降到低位元)→ DAC 核心(開關陣列)
        → I/V 轉換(若為電流輸出)→ 類比重建低通濾波 → 輸出緩衝

中間四個方塊各有各的失真來源,而它們的貢獻量級差很多。晶片手冊描述的是第 3–5 塊;成品的實測性能常常由第 6–7 塊決定(見 訊號鏈與介面)。


R-2R ladder:精度靠元件

R-2R 網路只用兩種阻值(R2R)串成梯形,每一位元對應一個開關,把該支路接到參考電壓或接地。網路的拓樸使得第 n 位元對輸出的貢獻恰好是第 n+1 位元的兩倍——二進位權重直接由電阻比例實現。

優點很直接:沒有 oversampling、沒有調變器、沒有回授迴路。輸入樣本進來,開關切換,輸出電壓在數十奈秒內建立。延遲極低、行為完全決定論、頻譜上沒有 noise shaping 帶來的超音頻雜訊。

問題也一樣直接:精度完全等於電阻的匹配度。

要保證 N-bit 的單調性(不會出現「數位值增加但類比輸出反而下降」),最高位元的權重誤差必須小於 ½ LSB,也就是滿刻度的 2^-(N+1)

位元數MSB 所需精度對應電阻容差
12-bit2^-130.012%
16-bit2^-170.00076%
20-bit2^-210.000048%

一般精密電阻是 0.1%;「超精密」薄膜電阻是 0.01%,對應約 12–13 位元。要做到 20-bit 的 R-2R,需要雷射修整、片上匹配、或大量人工挑選配對,而且電阻還會隨溫度漂移(追蹤溫度係數必須匹配,不只絕對值)。

這造成 R-2R 的特徵性失真:誤差在「大進位」處最嚴重。從 0111...1 跳到 1000...0 時,所有低位元關閉、MSB 開啟——這一步的誤差是整個轉換器最大的。而由於音樂訊號大量時間在中點附近擺盪,這個誤差集中發生在過零點與低電平,表現為低電平非線性:小訊號的失真比例遠高於大訊號。

實務上,商用 R-2R DAC 的實測線性度多在 17–19 位元之間,THD+N 在 -100 至 -110 dB。這仍是很好的數字,但低於同價位 delta-sigma 方案約 10–20 dB


Delta-sigma:精度靠時間

Delta-sigma 走完全相反的路:放棄元件精度,改用極少的位元(1 到 6 位)但以極高的速率輸出,再靠低通濾波把時間軸上的資訊換回振幅軸上的精度。

核心是兩個機制。

Oversampling:把訊號以 OSR 倍的速率取樣。量化雜訊的總功率固定為 q²/12,但它現在攤在 OSR 倍寬的頻譜上。低通濾掉可聞帶以外的部分,帶內雜訊功率降為 1/OSR——每倍頻 OSR 換 3 dB,即 ½ 位元。單靠 oversampling 效率太低。

Noise shaping:把量化器放進一個含積分器的回授迴路。迴路對訊號是低通、對量化雜訊是高通——雜訊被主動推出可聞帶。L 階調變器的帶內 SNR 每倍頻 OSR 改善 (6L + 3) dB

調變器階數每倍頻 OSR 的 SNR 增益
1 階9 dB
2 階15 dB
3 階21 dB
5 階33 dB

以 OSR = 64、5 階為例,理論帶內 SNR 增益超過 190 dB。實際做不到那麼多——高階迴路只是條件穩定,訊號一大就會失穩並產生大幅振盪,所以設計上必須大幅退讓(限制調變深度、把零點配置得保守)。但即使打了大折,delta-sigma 也輕鬆超越 R-2R 能達到的線性度。

關鍵在於:低位元量化器的線性度是天生的。 1-bit 量化器只有兩個輸出狀態,兩點必然共線——不可能有非線性。多位元(4–6 bit)雖有元件匹配問題,但只有 16–64 個元件要匹配(相較 R-2R 的 24 個二進位權重跨越六個數量級),且可用 **DEM(dynamic element matching,動態元件匹配)**在時間上輪替使用各元件,把靜態失配轉成寬頻雜訊。

代價是:超音頻有大量整形後的雜訊(必須靠類比濾波器處理,否則會進入下游擴大機造成 IMD),迴路有延遲,且行為不是純決定論的(有 idle tone 與極限環的風險)。


數位濾波器:oversampling 怎麼做,以及那些選項在改什麼

Delta-sigma 前面必須有一個內插濾波器:把 44.1 kHz 的樣本插值成 44.1 × OSR kHz。做法是在樣本間插入零值,再用 FIR 低通濾除因此產生的鏡像。

這個 FIR 的設計就是 DAC 面板上那幾個「濾波器」選項:

選項設計代價
Fast roll-off, linear phase陡峭、對稱係數全頻段相位線性;衝擊響應有前振鈴與後振鈴
Slow roll-off緩降振鈴少;20 kHz 附近有可測的衰減,且鏡像抑制不足
Minimum phase非對稱係數沒有前振鈴;代價是高頻相位偏移(群延遲隨頻率變化)
Apodizing提早滾降意圖抵消上游錄音鏈的振鈴,屬設計主張
NOS / filter off不內插見下節

關於「振鈴」值得說清楚,因為它被大量誤述。陡峭 FIR 的衝擊響應確實會前後振盪(Gibbs 現象)。但這種振鈴只在輸入含有超越 Nyquist 頻率的成分時才會被激發——而一段合法的、頻寬受限的音訊訊號,依定義不含這種成分。用一個理想脈衝(含無限頻寬)去測濾波器,看到振鈴是必然的;這不代表播放音樂時會出現同樣的波形。

這些選項之間的實測差異,主要落在 18–22 kHz 的頻響(fast 平坦到 20 kHz,slow 在 20 kHz 可衰減 1–3 dB)與超音頻鏡像抑制量上。可聞帶內的差異通常在 0.1 dB 以下。這是「機制真實、量級微小」的典型例子。


NOS:不做內插的取捨

NOS(non-oversampling)直接把樣本送進 DAC 核心,用 zero-order hold 輸出。它的支持論述是「沒有數位濾波器就沒有振鈴、沒有相位操弄,時域最忠實」。

代價可以精確算出來。ZOH 的頻率響應是 sinc 函數:

|H(f)| = | sin(π f / f_s) / (π f / f_s) |

f_s = 44.1 kHz 下:

頻率衰減
10 kHz−0.74 dB
15 kHz−1.7 dB
20 kHz−3.2 dB

20 kHz 掉 3.2 dB 是實質的頻響改變——比多數「不同 DAC 的聲音差異」大一個數量級。此外,NOS 沒有濾除 n·f_s ± f 的鏡像:一個 15 kHz 的音會在 29.1 kHz 與 59.1 kHz 出現全幅鏡像,這些超音頻能量進入下游擴大機後,經由非線性產生落回可聞帶的互調產物。

所以:NOS 聽起來確實不同——但原因是可量測的高頻滾降與鏡像,不是「更自然的時間軸」。 有些人偏好這種聲音(略暗的高頻),這是完全正當的偏好;但把它描述成「更忠實」則與量測相反。詳見 玄學與實證


常見晶片家族的實際差異

ESS Technology(SABRE)——旗艦 ES9039PRO 採用 Hyperstream IV 調變器架構,規格為單聲道模式 140 dB DNR、THD+N −122 dB,八聲道每聲道 132 dB DNR。晶片為電流輸出(輸出阻抗 195 Ω),因此必須外接 I/V 轉換級——這一級的設計品質對成品性能影響極大,也是同一顆晶片在不同機器上表現差異巨大的主因。ESS 另有內建的非同步取樣率轉換/抖動消除機制,對輸入時脈品質相對不敏感。

AKM(Velvet Sound)——旗艦方案把功能拆成兩顆晶片AK4191EQ 負責數位濾波與多位元 delta-sigma 調變(256 倍 oversampling),AK4499EXEQ 用 switched-resistor(切換電阻)方式做最終的數位轉類比。這個拆分的工程動機很明確:把高速數位切換的雜訊與敏感的類比轉換實體隔離,避免數位區的開關噪聲耦合進類比區。這是對「單晶片整合」的一次反向操作,代價是成本與板面積。

TI / Burr-Brown——PCM179x 系列為電流輸出、需外接 I/V;PCM5102 之類則整合了電壓輸出與電荷泵負電源,可直接驅動——適合小型與嵌入式應用,因為它把最難的類比段收進晶片內,同時也限制了發揮上限。

Cirrus Logic——CS43198 一類主打低功耗與高整合度,是行動裝置與便攜 DAC 的主流。

離散 R-2R ——沒有現成晶片,由廠商用精密電阻陣列(或多顆工業級 ladder DAC)自建。線性度上限受電阻匹配約束,但架構完全在廠商掌控中。

必須強調的是:晶片型號不預測成品性能。 同一顆 ES9038PRO 可以做出 SINAD 118 dB 的機器,也可以做出 SINAD 95 dB 的機器,差別在 I/V 級、類比濾波、電源與佈線。「用了旗艦晶片」是一句關於物料的敘述,不是關於性能的敘述。


一句話重點

R-2R 用元件精度換簡潔與決定論,delta-sigma 用時間平均與 noise shaping 換線性度——前者的失真集中在低電平與大進位處,後者的代價是超音頻雜訊與迴路穩定性;而兩者的成品表現,往往由晶片之後的類比輸出級決定,不是由架構決定。


下一篇時脈與 jitter — 上面所有討論都假設樣本在「正確的時刻」輸出。當這個假設不成立時會發生什麼。