В мире технологий, где безопасность контента становится все более актуальной, французская стартап-компания Mistral AI представила свою новейшую разработку — Shieldstral. Этот легковесный многомодальный ИИ-модуль способен классифицировать выходные данные AI-моделей, демонстрируя эффективность, превышающую другие крупные языковые модели в семь раз.
Shieldstral позволяет разработчикам формулировать политики в виде естественных языковых вопросов в реальном времени, а модель возвращает оценку безопасности. Она не требует специализированного переобучения и может обрабатывать как текст, так и изображения, предоставляя однозначный ответ в виде токена: "да" или "нет". Это делает результаты абсолютно ясными и понятными.
По данным компании, Shieldstral демонстрирует выдающиеся результаты в области текстовой безопасности, достигая или превышая показатели моделей, которые в семь раз больше по размеру, с общим средним баллом безопасности 84,9%. В области многомодальной безопасности изображений модель также показывает впечатляющие результаты — 83,8%, что превышает все оцененные базовые модели.
Работа Shieldstral основана на предоставлении разработчиками одной инструкции, которая четко формулирует задачу и контекст оценки. Например, можно задать вопрос: "Содержит ли эта реклама оскорбительный или небезопасный материал?" После этого модель анализирует предоставленный контент, будь то текст или изображение.
Интересно, что Shieldstral обучен различать, а не просто запоминать политики. Это означает, что в процессе рассуждений и классификации модель может применять две связанные, но разные политики и различать их. Например, она может определить, является ли контент инструкцией по созданию вредоносного ПО или обсуждением кибербезопасности, и соответственно отреагировать на каждую ситуацию.
С объемом всего в 3 миллиарда параметров, Shieldstral достаточно легковесен, чтобы работать на одном графическом процессоре с 16 ГБ памяти. Это позволяет ему эффективно функционировать даже в условиях ограниченных ресурсов, что делает его идеальным для использования в различных средах.
Mistral AI уверена, что Shieldstral станет важным шагом к более адаптивной модерации, которая сможет учитывать контекст, а не просто применять жесткие таксономические подходы. Это откроет новые горизонты для многоязычного и многомодального анализа безопасности в будущем.