Недавний аудит, проведенный Контрольным управлением Южной Кореи, выявил серьезные недостатки в управлении проектом по созданию наборов данных для обучения искусственного интеллекта (ИИ). Несмотря на внушительный бюджет в 1,6 трлн KRW, результаты оказались неутешительными: многие данные дублируются, а качество информации оставляет желать лучшего.
По состоянию на ноябрь прошлого года Министерство науки и ИКТ (MSIT) разработало 908 типов обучающих данных, доступных на платформе AI Hub. В дополнение к этому, 26 организаций, включая Министерство безопасности пищевых продуктов и лекарств, мэрию Сеула и Корейскую корпорацию автомагистралей, предоставляют 313 типов данных, которые могут быть использованы ИТ-компаниями.
Однако аудит показал, что многие агентства создавали дублирующие данные, не проверяя планы других организаций. Например, MSIT потратило 7,38 млрд KRW на создание данных для четырех категорий изображений, в то время как пять других организаций потратили дополнительно 610 млн KRW на аналогичные наборы данных.
В частности, данные о диких животных, предназначенные для предотвращения наезда на них автомобилей, оказались частично дублирующими. Из 60 000 изображений, собранных Корейской корпорацией автомагистралей в 2022 году, 25 000 (42%) совпадали с данными, созданными MSIT в 2021 году.
Качество данных также оставляет желать лучшего. Из 20 ведущих организаций, занимающихся созданием данных, 9 не проводили внешнюю проверку качества во время выполнения проектов. Например, набор данных о дорожных камерах, созданный Корейской корпорацией автомагистралей в 2025 году, не содержал важной информации о местоположении автомобилей, что делает его непригодным для обучения технологий автономного вождения.
Контрольное управление рекомендовало MSIT внедрить систему предварительного обзора для оценки возможности альтернативного использования существующих данных, а также наладить обмен планами по созданию данных между агентствами и установить стандарты управления качеством.