| α |
альфа |
learning rate, уровень значимости, коэффициент LoRA |
| β |
бета |
моменты в Adam, сила KL в RLHF/DPO, параметр распределения |
| γ |
гамма |
дисконт в RL, масштаб в нормализации |
| δ |
дельта |
маленькое изменение, вероятность «провала» в оценках |
| ε |
эпсилон |
маленькое число, шум, точность |
| η |
эта |
learning rate |
| θ |
тета |
параметры модели |
| λ |
лямбда |
сила регуляризации, собственное число |
| μ |
мю |
среднее |
| σ |
сигма |
стандартное отклонение, сигмоида |
| Σ |
Сигма |
сумма, матрица ковариации |
| π |
пи |
3.14159…, политика в RL |
| ρ |
ро |
корреляция, отношение вероятностей в PPO |
| τ |
тау |
температура, траектория в RL |
| φ, ψ |
фи, пси |
параметры энкодера, признаковые преобразования |
| ∇ |
набла |
градиент |
| ∂ |
«дэ» |
частная производная |
| ∝ |
пропорционально |
равенство с точностью до константы |
| ≈ |
примерно равно |
|
| ≜, := |
по определению |
|