В мире технологий наблюдается активная гонка за ускорением обработки AI-запросов, и стартап Kog из Франции делает ставку на оптимизацию существующих графических процессоров (GPU). В отличие от специализированных чипов, таких как у Cerebras, Kog уверенно заявляет, что можно извлечь гораздо больше мощности из стандартных GPU, которые уже есть у предприятий.
В мае стартап привлек внимание на Hacker News, представив технологический предварительный просмотр, который продемонстрировал, что "экстремально быстрая декодировка одного запроса возможна на стандартных дата-центровых GPU", таких как AMD MI300X и Nvidia H200. Несмотря на некоторые разочарования по поводу отсутствия поддержки ноутбучных GPU, многие увидели в этом огромный потенциал. В условиях, когда скорость обработки и затраты становятся критическими факторами, обещание Kog разблокировать новые возможности на существующем оборудовании привлекло более 200 бизнес-лидов.
Генеральный директор Kog, Гаэль Делальо, ожидает, что программная инженерия станет первым применением их технологии. Пользователи Claude Code знают, что иногда им приходится ждать часы, чтобы получить результаты. Kog нацеливается на клиентов, которые не хотят сталкиваться с такими задержками, особенно тех, кто использует AI для профессиональных задач. Кроме того, у стартапа есть партнеры по дизайну, которые позволяют пользователям создавать игры и приложения с помощью подсказок, и для них более быстрая обработка с помощью Kog Inference Engine (KIE) может означать увеличение доходов.
Однако Kog осознает, что рынок еще не полностью зрел. Потенциальные клиенты не готовы настраивать небольшие модели, поэтому с момента запуска компания сосредоточилась на ускорении разработки более крупных моделей, чтобы удовлетворить растущий спрос. Kog обещает "30x быстрее LLM-инференс", хотя на данный момент демонстрация показала впечатляющие 3000 токенов на запрос с использованием небольшой модели Laneformer 2B.
Делальо уверен, что их подход будет работать и с большими языковыми моделями (LLM), несмотря на их размер, который может быть проблемой для чипов. Он считает, что современные GPU имеют светлое будущее, и миф о том, что они не подходят для декодирования, необходимо развеять. Kog не единственный, кто считает, что программная оптимизация может помочь GPU делать больше, чем заявлено в спецификациях.
С командой из 11 человек Kog планирует углубиться в детали каждого нового GPU, что требует значительных временных затрат. В долгосрочной перспективе стартап надеется интегрировать свою методологию в агентные пайплайны, что позволит поддерживать больше чипов и моделей. Поддержка от Scaleway и программы Bpifrance и French Tech 2030 также добавляет уверенности в их будущем.
Сейчас Kog стоит перед задачей доказать свою эффективность на LLM, что станет ключевым моментом для привлечения дополнительного финансирования. Делальо уверен, что после реализации первой крупной модели с увеличением скорости в 10 раз, они смогут продемонстрировать клиентский интерес и начать привлечение средств для следующего раунда.