双随机投影的点积分布:Variance-Gamma 与夹角的遗忘

s = (Ma A)·(Mb B) = Aᵀ M B(M = MaᵀMb,对应注意力 score (xW_Q)·(yW_K))。 Ma、Mb 为 H×D 高斯矩阵(元素方差 1/D,初始化缩放),A、B 为单位向量,ρ = cos(A, B) 精确受控。 蓝线:方案一精确密度(对称 Variance-Gamma,Bessel-K 分布)——与 ρ 严格无关红线:方案二/三的实例高斯——均值偏移 ρ·trM/D 由本批矩阵的 trM 决定,方向随机青色填充:蒙特卡洛直方图。 数学背景见 docs/qk-spectrum.md 的姊妹问题(那里看奇异值谱,这里看 score 标量)。

曲线: 横轴:

公式(单位向量 A、B;β = (1/D)·‖A‖‖B‖ = 1/D;ν = (H−1)/2):

对象密度 / 矩备注
方案一:精确密度
(对称 Variance-Gamma)
f(s) = 2|s|^ν K_ν(|s|/β) / [(2β)^(ν+1) √π Γ(H/2)]
方差 Hβ²,超额峰度 6/H
与 ρ 严格无关(双各向同性);H = 1:K₀(|s|/β)/(πβ),原点对数发散;
H = 2:Laplace e^(−|s|/β)/(2β);H → ∞:高斯化
方案二/三:条件矩
(固定 M,大维近似)
E[s] = ρ·trM/D
Var(s) = [2ρ²‖M_s‖²_F + (1−ρ²)‖M‖²_F]/D²
随机无关矩阵:trM 均值 0、std √(H/D)(换种子变号),
‖M‖²_F ≈ H concentrate ⇒ 均值效应 ~ ρ/√D 被维度压没
方案三:trM 的确定性来源 Mb = αMa + √(1−α²)G ⇒ trM ≈ αH ± √(H/D) 均值偏移 ραH/D 是稳定信号,信噪比 ~ ρα√(HD)·… 随维度增强;
对应训练后 W_QW_Kᵀ 脱离各向同性基线
对照:单投影保内积 E[(PA)·(PB)] = σ²H·(A·B),而 E[(MaA)·(MbB)] = 0 单个随机投影保内积(JL 引理);两个独立投影遗忘内积——
随机初始化的注意力对 token 相关性是盲的

两方案的关系:ρ = 0 时方案二对矩阵系综取平均(退火)后与方案一严格同一分布 ((A, B, M) 的联合分布相同);ρ ≠ 0 时方案一的分布严格不动,方案二的均值偏移 ρ·trM/D 依赖矩阵实例、系综平均为 0——这个差异本身就是 M 偏离各向同性的探针。 用自由概率的语言:随机无关的 Ma、Mb 使 M 与 (A, B) 的取向渐近自由, QK 训练的本质就是打破这种自由性。