Как читать рейтинги нейросетей и не обмануться первой строчкой

Как читать рейтинги нейросетей: что означает Elo, почему у арен разные лидеры, на что смотреть кроме первой строчки и когда рейтинг вообще не отвечает на ваш вопрос.
Рейтинги моделей выглядят убедительно: таблица, цифры, первое место. Проблема в том, что первая строчка отвечает не на тот вопрос, который у вас есть. Разберу, как читать рейтинги нейросетей, чтобы они помогали выбирать, а не создавали ложную уверенность.
Что вообще меряет Elo
Механика простая: людям показывают две генерации по одному запросу, не говоря, какая модель что сделала, человек выбирает лучшую. Из тысяч таких пар считается рейтинг, где выше тот, кого чаще предпочитают. Ключевое слово тут «предпочитают»: цифра отражает общее впечатление людей на случайных сценах, а не пригодность к вашей задаче.
Почему у разных арен разные лидеры
Нормальная ситуация, которая многих сбивает. У площадок разные наборы тестовых запросов, разные аудитории голосующих и своя шкала. Поэтому модель, первая на одной арене, может быть третьей на другой. Практический вывод: смотреть две-три площадки и ориентироваться на совпадающий вывод, а не на одну красивую строчку. Свежие срезы мы разбираем в наших исследованиях, например рейтинг нейросетей для картинок.
Как читать рейтинги нейросетей: не только место
Три вещи, которые важнее номера строчки. Число голосов: у модели с парой тысяч оценок место шаткое, у модели с сотнями тысяч устойчивое. Пометка Preliminary означает, что данных пока мало. И разрыв в баллах: если между вторым и пятым местом разница в несколько пунктов, они практически равны, и выбирать между ними по рейтингу бессмысленно.
Чего рейтинг не покажет никогда
Он не знает вашего товара, не меряет цену за генерацию и скорость, не проверяет русский текст на упаковке. Не оценивает, бережно ли модель обращается с вашим исходным фото. Всё это решает на практике больше, чем место в таблице, поэтому я использую рейтинг как короткий список кандидатов, а не как вердикт.
Так что честный ответ на вопрос «какая модель лучшая» звучит скучно: та, что лучше справилась с вашей конкретной сценой. Проверить кандидатов из верхушки на своём товаре можно во Flami, это надёжнее любой таблицы.
Часто задаваемые вопросы
Что означает Elo в рейтингах нейросетей?
Это рейтинг на основе слепых парных сравнений: людям показывают две генерации по одному запросу, они выбирают лучшую, из тысяч таких пар считается балл. Он отражает усреднённое предпочтение, а не пригодность модели к конкретной задаче.
Почему у разных арен разные лидеры?
У площадок разные наборы тестовых запросов, аудитории голосующих и шкалы, поэтому места не совпадают. Практичнее смотреть две-три арены и ориентироваться на совпадающий вывод, а не на одну строчку в одной таблице.
На что смотреть в рейтинге кроме места?
На число голосов, пометку Preliminary и разрыв в баллах. Модель с парой тысяч оценок стоит шатко, а если между вторым и пятым местом разница в несколько пунктов, они практически равны и выбор по рейтингу теряет смысл.
Можно ли выбрать модель только по рейтингу?
Не стоит: рейтинг не знает вашего товара, не учитывает цену и скорость, не проверяет русский текст и бережность к исходному фото. Его удобно использовать как короткий список кандидатов, которых потом тестируют на своей задаче.
Источники
Об авторе
Артём Соколов
Обозреватель Flami