prime-rl

Если ты работаешь с Reinforcement Learning и тебе нужно масштабировать обучение до тысяч GPU, то этот фреймворк может стать твоим спасением. Он заточен под асинхронное обучение и позволяет тренировать огромные модели, не теряя в производительности.
Это целый фреймворк для RL, написанный на Python, который включает в себя инструменты для SFT, обучения и оценки моделей. С ним удобно работать и на одной GPU, и на кластере из 1000+ GPU, используя Slurm или Kubernetes.
Особенно круто, что он нативно интегрируется с 'verifiers' окружениями, включая SWE и другие агентные среды. А ещё есть поддержка мультимодальных моделей, типа Qwen3-VL, что расширяет горизонты применения.
https://github.com/PrimeIntellect-ai/prime-rl | 1775 звёзд
#сервисы


