公式(单位向量 x;ψ、ψ′ 为 digamma/trigamma):
| 对象 | 密度 / 矩 | 备注 |
|---|---|---|
| 卡方因子化(精确) | s = χ²_M·χ²_D/(DM),两个独立卡方因子 | 中间层 ‖Bx‖² = varB·χ²_M;条件于 z = Bx,‖Az‖² = (‖z‖²/M)χ²_D 且独立; 与 x 方向严格无关(各向同性) |
| 中间层 z = Bx | s = varB·χ²_M = Gamma(k, θ),k = M/2,θ = 2·varB;均值 M·varB varB = 1/D:均值 M/D;varB = 1/M:均值 1、方差 2/M |
M = 1:s^(−1/2) 原点发散;M = 2:指数分布;M 大:高斯化。 varB = 1/D 时瓶颈压缩 ⇒ 典型长度 √(M/D); varB = 1/M 时与完整块同刻度(均值 1),只剩 M 控制的涨落 |
| 完整块 AB:K_ν 乘积伽马(精确) | f(s) = 2s^(k̄−1)K_{k1−k2}(2√(s/θ₁θ₂)) / (Γ(k₁)Γ(k₂)(θ₁θ₂)^k̄) k₁ = M/2,θ₁ = 2/D,k₂ = D/2,θ₂ = 2/M,k̄ = (k₁+k₂)/2 |
均值恰 1(配对 fan-in);ν = (M−D)/2 任意阶 K_ν(积分表示 + 递推, log 域);M = D = 2 时原点对数发散;右尾 e^(−2√(s/θ₁θ₂)) 拉伸指数 |
| 完整块矩(精确) | 均值 1;方差 2/M + 2/D + 4/(MD) 对数域:E ln s = ψ(M/2)−ln(M/2) + ψ(D/2)−ln(D/2) ≈ −(1/M+1/D) Var(ln s) = ψ′(M/2)+ψ′(D/2);中位数 ≈ e^(−(1/M+1/D)) |
均值恒 1 但中位数 < 1:均值被重尾(上投 A 注入的 2/D 涨落)撑着, 典型样本偏小;瓶颈越窄(M 小)偏得越多 |
| 方案二(quenched)球面二次型 | E_x[s] = trW/D,Var_x(s) = 2[trW² − (trW)²/D] / (D(D+2)) (W = PᵀP,P = AB;不构造 D×D 的 P: trW = ‖AB‖²_F = tr G、tr(W²) = tr(G²),G = (AᵀA)(BBᵀ) 为 M×M) |
self-averaging:实例内方差 ≈ annealed 方差的大部分(形状不动); 中心 trW/D 跳动:中间层 √(2M·varB²/D)、完整块 √((2M+4D+2)/(MD²)),随维度消失 (trW 是平方和的自平均——对照 proj-dot-demo 的 trM 符号和, 涨落 √(H/D) 不消失) |
| 方案二实例形状(右偏) | 固定 W 后 s = Σᵢ₌₁^M λᵢuᵢ²(λᵢ 为 W 特征值、u 球面坐标)——秩 ≤ M 的加权卡方和,正偏:众数 < 中位数 < 均值 trW/D, 偏度 γ₁ ~ √(8/M_eff),M_eff = (trW)²/tr(W²) | "实例高斯"(红虚线)只配前两矩、对称,峰钉在均值 ⇒ 直方图峰系统性偏左 ≈ σ·γ₁/2、右尾更厚——不是误差,是形状。"实例偏态"(紫)= 精确形状 (伽马/K_ν)标准化后仿射到实例矩:f(s) = f₀(c + (s−trW/D)/b)/b, b = √(Var_inst/Var₀),峰位对齐;α > 0 时特征值更散、M_eff 更小、偏更甚 |
与 FFN / 低秩投影的联系:y = ABx 正是"降维-升维"瓶颈块(FFN、适配器、 LoRA 式结构)的初始化零模型——1/D 与 1/M 的配对缩放让长度期望保值(均值 1), 但两个卡方涨落相乘 ⇒ 单块即重尾化、典型长度偏小(中位数 ≈ e^(−(1/M+1/D))); 瓶颈比 M/D 越小,相对方差 2/M+2/D+4/(MD) 越大。方案二不构造 D×D 的 P (采样分步 z=Bx、‖Az‖²,O(MD)/样本;实例矩用 M×M 小矩阵),所以 D 可达 8192。 训练后的权重谱脱离随机基线,长度的实际行为也随之偏离——本页是对照零模型。