beta

val beta: Double? = null

Weight for KL Divergence regularization, Preference Optimization tuning only.