Переход на новый MLX-движок от Ollama стал настоящим прорывом для пользователей, работающих с локальными языковыми моделями на Mac. Многие отмечают, что их устройства, даже такие как MacBook Air с 16 ГБ оперативной памяти, стали работать значительно быстрее. Это связано с тем, что новый движок оптимизирует использование ресурсов, что особенно важно для моделей, требующих больших вычислительных мощностей.
Ранее пользователи сталкивались с замедлением работы системы при запуске локальных LLM, но с обновлением MLX ситуация изменилась. Теперь все процессы стали более отзывчивыми, а время обработки запросов сократилось почти вдвое. Это особенно заметно при использовании таких инструментов, как Claude Code и других помощников по программированию.
Одним из ключевых улучшений является более эффективное управление памятью. Новый движок использует архитектуру единой памяти Apple, что позволяет CPU и GPU совместно работать с одним пулом памяти, минимизируя ненужные перемещения данных. Это не только ускоряет обработку, но и улучшает качество выводимых результатов.
Кроме того, Ollama внедрил поддержку нового формата квантования NVFP4, который значительно снижает потери качества при уменьшении объема памяти, необходимой для работы моделей. Это особенно актуально для пользователей, работающих с меньшими моделями, которые теперь могут выдавать более качественные результаты без необходимости в мощном оборудовании.
Также стоит отметить, что Ollama переработал рабочие процессы агентов, что позволяет более эффективно управлять состоянием модели во время работы. Это означает, что пользователи могут быстрее получать результаты, не тратя время на повторную обработку одного и того же контекста.
В целом, обновление MLX от Ollama стало важным шагом вперед для всех, кто использует локальные языковые модели на Mac. Улучшенная производительность и качество выводимых данных делают этот движок одним из самых значительных обновлений для пользователей, стремящихся к более эффективной работе с AI.