瓶颈投影块的长度平方分布:y = ABx

s = ‖ABx‖²:B 为 M×D(元素方差 1/D,下投)、A 为 D×M(方差 1/M,上投) 的独立高斯矩阵,x 为单位向量——配对 fan-in 使 E‖ABx‖² = ‖x‖², 长度期望保值(均值恒 1)。M ∈ [1, 4D] 控制瓶颈宽度。 观测目标可选完整块 y 或中间层 z = Bx(压缩分布,B 方差可选 1/D——均值 M/D, 或 1/M——均值归一 = 1)。 蓝线:精确理论(中间层伽马 varB·χ²_M / 单块 K_ν 乘积伽马)红虚线:方案二实例高斯(只配前两矩,精度逊)紫线:实例偏态——精确形状(伽马/K_ν)平移缩放到实例矩, 峰位对齐直方图(实例分布右偏,众数 < 均值)青色填充:蒙特卡洛直方图。 均值恒 1,但中位数 ≈ e^(−(1/M+1/D))——均值被重尾撑着、典型样本偏小。 姊妹篇:spectrum-demo(谱)、proj-dot-demo(点积)。

曲线: 横轴: 纵轴:

公式(单位向量 x;ψ、ψ′ 为 digamma/trigamma):

对象密度 / 矩备注
卡方因子化(精确) s = χ²_M·χ²_D/(DM),两个独立卡方因子 中间层 ‖Bx‖² = varB·χ²_M;条件于 z = Bx,‖Az‖² = (‖z‖²/M)χ²_D 且独立; 与 x 方向严格无关(各向同性)
中间层 z = Bx s = varB·χ²_M = Gamma(k, θ),k = M/2,θ = 2·varB;均值 M·varB
varB = 1/D:均值 M/D;varB = 1/M:均值 1、方差 2/M
M = 1:s^(−1/2) 原点发散;M = 2:指数分布;M 大:高斯化。 varB = 1/D 时瓶颈压缩 ⇒ 典型长度 √(M/D); varB = 1/M 时与完整块同刻度(均值 1),只剩 M 控制的涨落
完整块 AB:K_ν 乘积伽马(精确) f(s) = 2s^(k̄−1)K_{k1−k2}(2√(s/θ₁θ₂)) / (Γ(k₁)Γ(k₂)(θ₁θ₂)^k̄)
k₁ = M/2,θ₁ = 2/D,k₂ = D/2,θ₂ = 2/M,k̄ = (k₁+k₂)/2
均值恰 1(配对 fan-in);ν = (M−D)/2 任意阶 K_ν(积分表示 + 递推, log 域);M = D = 2 时原点对数发散;右尾 e^(−2√(s/θ₁θ₂)) 拉伸指数
完整块矩(精确) 均值 1;方差 2/M + 2/D + 4/(MD)
对数域:E ln s = ψ(M/2)−ln(M/2) + ψ(D/2)−ln(D/2) ≈ −(1/M+1/D)
Var(ln s) = ψ′(M/2)+ψ′(D/2);中位数 ≈ e^(−(1/M+1/D))
均值恒 1 但中位数 < 1:均值被重尾(上投 A 注入的 2/D 涨落)撑着, 典型样本偏小;瓶颈越窄(M 小)偏得越多
方案二(quenched)球面二次型 E_x[s] = trW/D,Var_x(s) = 2[trW² − (trW)²/D] / (D(D+2))
(W = PᵀP,P = AB;不构造 D×D 的 P: trW = ‖AB‖²_F = tr G、tr(W²) = tr(G²),G = (AᵀA)(BBᵀ) 为 M×M)
self-averaging:实例内方差 ≈ annealed 方差的大部分(形状不动); 中心 trW/D 跳动:中间层 √(2M·varB²/D)、完整块 √((2M+4D+2)/(MD²)),随维度消失 (trW 是平方和的自平均——对照 proj-dot-demo 的 trM 符号和, 涨落 √(H/D) 不消失)
方案二实例形状(右偏) 固定 W 后 s = Σᵢ₌₁^M λᵢuᵢ²(λᵢ 为 W 特征值、u 球面坐标)——秩 ≤ M 的加权卡方和,正偏:众数 < 中位数 < 均值 trW/D, 偏度 γ₁ ~ √(8/M_eff),M_eff = (trW)²/tr(W²) "实例高斯"(红虚线)只配前两矩、对称,峰钉在均值 ⇒ 直方图峰系统性偏左 ≈ σ·γ₁/2、右尾更厚——不是误差,是形状。"实例偏态"(紫)= 精确形状 (伽马/K_ν)标准化后仿射到实例矩:f(s) = f₀(c + (s−trW/D)/b)/b, b = √(Var_inst/Var₀),峰位对齐;α > 0 时特征值更散、M_eff 更小、偏更甚

与 FFN / 低秩投影的联系:y = ABx 正是"降维-升维"瓶颈块(FFN、适配器、 LoRA 式结构)的初始化零模型——1/D 与 1/M 的配对缩放让长度期望保值(均值 1), 但两个卡方涨落相乘 ⇒ 单块即重尾化、典型长度偏小(中位数 ≈ e^(−(1/M+1/D))); 瓶颈比 M/D 越小,相对方差 2/M+2/D+4/(MD) 越大。方案二不构造 D×D 的 P (采样分步 z=Bx、‖Az‖²,O(MD)/样本;实例矩用 M×M 小矩阵),所以 D 可达 8192。 训练后的权重谱脱离随机基线,长度的实际行为也随之偏离——本页是对照零模型。