Arquitectura de posentrenamiento y aprendizaje por refuerzo
SWE-2 se posentrena a partir de Kimi K3, escalando el aprendizaje por refuerzo a un modelo de múltiples billones de parámetros para optimizar el rendimiento en distintos niveles de esfuerzo de razonamiento en una sola ejecución de entrenamiento.
La arquitectura de entrenamiento utiliza una línea base de recompensa ponderada por longitud para estabilizar la varianza del gradiente sin requerir pasadas hacia atrás adicionales. Los despliegues de inferencia se basan en kernels NVFP4 y FP8 junto con decodificación especulativa respaldada por un modelo borrador actualizado en línea.
- Incorpora penalizaciones lineales adaptadas a la pendiente local de la curva de frontera del modelo base en todos los niveles de esfuerzo.
- Aplica líneas base grupales ponderadas por longitud para reducir la divergencia de políticas entre el entrenamiento y la inferencia.
- Utiliza kernels NVFP4 y FP8 de baja precisión con entrenamiento consciente de la cuantización para gestionar la sobrecarga de memoria durante los despliegues.