AI concepts
Concetps protocol
definition?
Logits
### Logit 的严格含义
二分类中,logit 是概率的对数优势:
# $$
\operatorname{logit}(p)
\log\frac{p}{1-p}
$$
多分类模型中,通常把 Softmax 前、用于参数化类别分布的向量 称为 logits:
# $$
p_i
\frac{e^{z_i}}{\sum_j e^{z_j}}
$$
它与对数概率比满足:
# $$
z_i-z_j
\log\frac{p_i}{p_j}
$$
所以 logits 不是“尚未归一化的概率”,而是:
> categorical distribution 的实数自然参数;其差值表示类别之间的 log-odds。
单个 logit 的绝对值也不唯一,因为:
# $$
\operatorname{softmax}(z+c\mathbf 1)
\operatorname{softmax}(z)
$$
真正有意义的是 logits 之间的差值。
### LLM 中的 vocabulary logits
LLM 最后一层通常产生词表维向量:
$$
z=hW_U+b
$$
然后:
# $$
p(\text{token}=j\mid\text{context})
\operatorname{softmax}(z)_j
$$
这里的 才是通常所说的 vocabulary logits,因为它参数化的是“下一个 token”的 categorical distribution。
### Attention 中则不同
Attention 中:
# $$
L
\frac{QK^\top}{\sqrt{d_k}}+M
$$
更稳妥的名称是:
- compatibility scores;
- attention scores;
- pre-softmax attention scores。
现代资料有时称其为 attention logits,但这是一种后来的术语扩展。当前 Transformer 原文证据使用的是 Softmax、scaled dot
products 等表述,并没有直接使用 logit/logits 这个词。