Создан инструмент для диагностики данных перед обучением ИИ-моделей

Служба новостей Автор статьи
Сбербанк и Институт AIRI представили открытый и...

AI Изображение создано с помощью ИИ и носит иллюстративный характер

В Москве 13 августа презентовали открытый инструмент SplitLight. Его разработали специалисты Центра практического искусственного интеллекта Сбербанка и Института AIRI для проверки датасетов перед обучением рекомендательных моделей. О новинке рассказали в пресс-службе Сбера. Об этом рассказывает издание ТАСС.

Инструмент выявляет неполадки в журналировании событий, смещенные временные метки и дубликаты. Такие дефекты влияют на итоговые метрики. SplitLight также фиксирует статистические характеристики подходов к формированию выборок. Это упрощает воспроизведение экспериментов и сравнение результатов различных команд.

Вторая функция — оценка соответствия теста реальным условиям работы. Система проверяет, не попали ли в обучающий набор данные из будущего, учитываются ли новые пользователи и объекты, а также степень различия тренировочной и валидационной выборок. По словам директора по AI-трансформации Сбербанка Сергея Рябова, для продуктовых команд в маркетплейсах, стримингах и медиа это надежная защита перед дорогими экспериментами. Быстрая проверка данных, корректный сплит и приближенность теста к реальности снижают риск внедрения моделей, эффективных лишь на бумаге.

Исследовательским группам SplitLight облегчает документирование, воспроизводимость и сравнение с публикациями. Команда во главе с Алексеем Васильевым, исполнительным директором по исследованию данных, опробовала инструмент на шести известных открытых датасетах. Тестирование показало: даже незначительные отклонения при разбиении данных заметно меняют метрики и оценку качества модели.