
Яндекс предложил оценивать ИИ по уровню соответствия ценностям
Разработчики Яндекса представили концепцию национального датасета, с помощью которого нейросети будут проверять на этичность и соответствие российским стандартам. Инициатива, обсуждаемая в правительстве, предполагает создание системы бенчмарков, способных оценивать не только техническую эффективность алгоритмов, но и их способность следовать заданным духовно-нравственным ориентирам в процессе генерации ответов.
Идея создания единого набора тестовых заданий вызвала дискуссию между представителями госсектора и ИТ-индустрии. Ключевой вопрос заключается в уровне прозрачности этих тестов. ФСБ настаивает на закрытом формате проверки, опасаясь, что разработчики начнут подстраивать модели под конкретные вопросы, превращая тестирование в простую подгонку ответов. Бизнес, напротив, указывает на риски: без понимания критериев оценки процесс превращается в непредсказуемую лотерею, замедляющую релизные циклы нейросетей.
В качестве компромисса обсуждается гибридная модель. Она предполагает наличие открытого бенчмарка для предварительной отладки алгоритмов в лабораториях и закрытого — для финальной верификации. Эксперты подчеркивают, что оценка «ценностных» ответов принципиально отличается от проверки математических задач, где существуют эталонные решения. В случае с этическими нормами требуется сложная экспертная или рубрикаторная система, которая пока не утверждена. Сейчас проект находится на стадии обсуждения в рабочих группах под эгидой аппарата вице-премьера Дмитрия Григоренко, а окончательные механизмы контроля и состав комиссии, ответственной за содержание тестов, еще не определены.



Комментарии (0)
Пока нет комментариев. Будьте первым!