Netflix не просто использует сторонние API для работы с большими языковыми моделями (LLM), а создал собственную платформу, которая охватывает весь процесс — от развертывания моделей до их интеграции в производственные системы. Это решение позволяет избежать проблем, связанных с использованием внешних сервисов, и обеспечивает большую гибкость и контроль.
Архитектура платформы основана на единой системе обслуживания, которая управляет всеми этапами обработки запросов: от маршрутизации и A/B тестирования до генерации кандидатов и логирования. В зависимости от модели, инференс может выполняться как локально, так и с использованием удалённых GPU через Model Scoring Service (MSS), который поддерживает различные фреймворки, включая TensorFlow и PyTorch.
Одним из ключевых решений стало использование vLLM в качестве основного движка. Это решение позволило Netflix быстро адаптироваться к изменяющимся требованиям и улучшить производительность. Платформа также поддерживает гибкую упаковку моделей, что позволяет легко обновлять их без необходимости синхронизации с фронтендом.
Для доступа к системе Netflix использует совместимый с OpenAI API интерфейс, что упрощает переход от использования хостинговых моделей к собственным. Это позволяет разработчикам легко интегрировать и тестировать новые модели, минимизируя изменения в коде.
Важным аспектом является стратегия развертывания новых версий моделей. Netflix применяет подходы Red-Black и Versioned, что позволяет избежать потерь запросов и обеспечивает плавный переход между версиями.
Платформа также включает в себя механизмы для мониторинга и управления производительностью, что позволяет команде оперативно реагировать на возникающие проблемы. В результате Netflix создал мощную и гибкую систему для обслуживания LLM, которая отвечает современным требованиям бизнеса и технологий.
В будущем компания планирует продолжать развивать свою платформу, внедряя новые технологии и улучшая существующие процессы, чтобы оставаться на передовой в области машинного обучения и искусственного интеллекта.