Архитектура пост-обучения и обучение с подкреплением
SWE-2 прошла пост-обучение на базе Kimi K3, масштабируя обучение с подкреплением на модель с триллионами параметров для оптимизации производительности на разных уровнях усилий рассуждения за один цикл обучения.
Архитектура обучения использует базовый уровень вознаграждения, взвешенный по длине, для стабилизации дисперсии градиента без необходимости дополнительных обратных проходов. Развертывание и генерация опираются на ядра NVFP4 и FP8, а также на спекулятивное декодирование с драфт-моделью, обновляемой в реальном времени.
- Включает линейные штрафы, согласованные с локальным наклоном границы эффективности базовой модели на различных уровнях усилий.
- Применяет групповые базовые линии, взвешенные по длине, для уменьшения расхождения стратегий между обучением и инференсом.
- Использует ядра низкой точности NVFP4 и FP8 с квантованием при обучении для снижения накладных расходов на память при генерации ответов.