曲线:
横轴:
公式(单位向量 A、B;β = (1/D)·‖A‖‖B‖ = 1/D;ν = (H−1)/2):
| 对象 | 密度 / 矩 | 备注 |
|---|---|---|
| 方案一:精确密度 (对称 Variance-Gamma) |
f(s) = 2|s|^ν K_ν(|s|/β) / [(2β)^(ν+1) √π Γ(H/2)] 方差 Hβ²,超额峰度 6/H |
与 ρ 严格无关(双各向同性);H = 1:K₀(|s|/β)/(πβ),原点对数发散; H = 2:Laplace e^(−|s|/β)/(2β);H → ∞:高斯化 |
| 方案二/三:条件矩 (固定 M,大维近似) |
E[s] = ρ·trM/D Var(s) = [2ρ²‖M_s‖²_F + (1−ρ²)‖M‖²_F]/D² |
随机无关矩阵:trM 均值 0、std √(H/D)(换种子变号), ‖M‖²_F ≈ H concentrate ⇒ 均值效应 ~ ρ/√D 被维度压没 |
| 方案三:trM 的确定性来源 | Mb = αMa + √(1−α²)G ⇒ trM ≈ αH ± √(H/D) | 均值偏移 ραH/D 是稳定信号,信噪比 ~ ρα√(HD)·… 随维度增强; 对应训练后 W_QW_Kᵀ 脱离各向同性基线 |
| 对照:单投影保内积 | E[(PA)·(PB)] = σ²H·(A·B),而 E[(MaA)·(MbB)] = 0 | 单个随机投影保内积(JL 引理);两个独立投影遗忘内积—— 随机初始化的注意力对 token 相关性是盲的 |
两方案的关系:ρ = 0 时方案二对矩阵系综取平均(退火)后与方案一严格同一分布 ((A, B, M) 的联合分布相同);ρ ≠ 0 时方案一的分布严格不动,方案二的均值偏移 ρ·trM/D 依赖矩阵实例、系综平均为 0——这个差异本身就是 M 偏离各向同性的探针。 用自由概率的语言:随机无关的 Ma、Mb 使 M 与 (A, B) 的取向渐近自由, QK 训练的本质就是打破这种自由性。