omlx

Если вы активно работаете с LLM на своём Mac, то oMLX — это просто находка! Он позволяет запускать большие языковые модели прямо на Apple Silicon, причём очень эффективно. Больше не придётся выбирать между удобством и полным контролем над моделями.
Это сервер для инференса LLM, VLM, OCR и других моделей, написанный на Python, который оптимизирован специально под "железо" Apple. Управлять им можно как через удобное приложение в менюбаре macOS, так и через CLI.
Главная фишка oMLX — это многоуровневое кеширование KV-пар, когда часто используемые данные хранятся в оперативной памяти, а остальные — на SSD. Даже после перезагрузки сервера или смены контекста кеш сохраняется, что очень круто для реальной работы.
https://github.com/jundot/omlx | 18058 звёзд
#сервисы


