QiuQiu

AI concepts

Concetps protocol

definition?

Logits

 ### Logit 的严格含义

  二分类中,logit 是概率的对数优势:

  # $$

  \operatorname{logit}(p)

  \log\frac{p}{1-p}

  $$

  多分类模型中,通常把 Softmax 前、用于参数化类别分布的向量 zz 称为 logits:

  # $$

  p_i

  \frac{e^{z_i}}{\sum_j e^{z_j}}

  $$

  它与对数概率比满足:

  # $$

  z_i-z_j

  \log\frac{p_i}{p_j}

  $$

  所以 logits 不是“尚未归一化的概率”,而是:

  > categorical distribution 的实数自然参数;其差值表示类别之间的 log-odds。

  单个 logit 的绝对值也不唯一,因为:

  # $$

  \operatorname{softmax}(z+c\mathbf 1)

  \operatorname{softmax}(z)

  $$

  真正有意义的是 logits 之间的差值。

  ### LLM 中的 vocabulary logits

  LLM 最后一层通常产生词表维向量:

  $$

  z=hW_U+b

  $$

  然后:

  # $$

  p(\text{token}=j\mid\text{context})

  \operatorname{softmax}(z)_j

  $$

  这里的 zz 才是通常所说的 vocabulary logits,因为它参数化的是“下一个 token”的 categorical distribution。

  ### Attention 中则不同

  Attention 中:

  # $$

  L

  \frac{QK^\top}{\sqrt{d_k}}+M

  $$

  更稳妥的名称是:

  - compatibility scores;

  - attention scores;

  - pre-softmax attention scores。

  现代资料有时称其为 attention logits,但这是一种后来的术语扩展。当前 Transformer 原文证据使用的是 Softmax、scaled dot

  products 等表述,并没有直接使用 logit/logits 这个词。