Telegram — лонгриды

prime-rl

Изображение из Telegram поста
prime-rl

Если ты работаешь с Reinforcement Learning и тебе нужно масштабировать обучение до тысяч GPU, то этот фреймворк может стать твоим спасением. Он заточен под асинхронное обучение и позволяет тренировать огромные модели, не теряя в производительности.

Это целый фреймворк для RL, написанный на Python, который включает в себя инструменты для SFT, обучения и оценки моделей. С ним удобно работать и на одной GPU, и на кластере из 1000+ GPU, используя Slurm или Kubernetes.

Особенно круто, что он нативно интегрируется с 'verifiers' окружениями, включая SWE и другие агентные среды. А ещё есть поддержка мультимодальных моделей, типа Qwen3-VL, что расширяет горизонты применения.

https://github.com/PrimeIntellect-ai/prime-rl | 1775 звёзд

#сервисы

Вам также может понравиться