HappyHorse 1.0: обзор на товарных роликах, где модель вывозит, а где сыпется

HappyHorse 1.0 на предметке: как держит физику, отражения и детализацию товара на движении, с какими задачами справляется и где честно проседает.
Меня зовут Артём, продуктовый инженер во Flami, я гоняю видеомодели на товарных роликах и считаю, где они вывозят, а где сыпятся. В начале апреля в арене Artificial Analysis вылезла модель с дурацким именем HappyHorse и без всяких опознавательных знаков просто села на первую строчку. Никто сначала не понял, чьё это. Через пару дней Alibaba призналась, что это её разработка. Я, честно, сперва отнёсся скептически: анонимные модели на лидербордах появляются регулярно, потом тихо исчезают. А эта осталась. И когда я сел гонять её на предметке, понял, за что её хвалят.
Если коротко: когда в кадре товар и важна детализация, чтобы ничего не «плыло» на движении, HappyHorse сейчас у меня в первой тройке кандидатов.
Откуда вообще взялась эта лошадь
Седьмого апреля в видеоарене Artificial Analysis появилась модель HappyHorse-1.0 без указания автора и сразу обошла прошлого чемпиона, Seedance 2.0. Десятого апреля Alibaba подтвердила CNBC, что HappyHorse это её проект, разработка подразделения ATH внутри Taotian Group, и модель ещё в работе. Команду возглавляет Чжан Ди, бывший вице-президент Kuaishou и человек, стоявший за Kling. То есть это не студенты в гараже, а люди, которые уже один раз сделали топовую видеомодель. Сам анонс и позиции модели на бенчмарках я разбирал отдельно, здесь же меня интересует только то, что она даёт на товарных задачах.
Под капотом, если верить сайтам команды, единый трансформер на 15 миллиардов параметров, который генерит видео и звук за один проход, без отдельных стадий постобработки. Большинство конкурентов собирают результат конвейером, тут всё в одном движке. Поддержка семи языков с губной синхронизацией, заявленная скорость порядка 38 секунд на ролик в 1080p на одной H100.
Почему я полез её тестировать на предметке
Бенчмарк бенчмарком, а мне важна конкретная задача: товар в кадре, который должен выглядеть живым и не разваливаться на движении.
Стабильность движений. Я прогнал промпт «человек крутит обруч и приседает». У большинства моделей на таком обруч либо вылетает из кадра, либо превращается в кашу. HappyHorse удержала и геометрию обруча, и пропорции тела через всё приседание. Никакого характерного «дрейфа», когда объект медленно плывёт сам по себе.
Отражения. Вот это меня зацепило. Чашка на глянцевом столе, отражение в поверхности движется синхронно с предметом, сохраняет пропорции и свет. Зеркала, хром, вода, у HappyHorse оптика отражений правда работает, а не мажет пятном. Для fashion и для премиум-продуктов, где половина кадра это блеск поверхности, это серьёзный плюс.
Жидкости и текстуры. Кофейная пенка, латте-арт, капли, дым. Жидкость подчиняется физике поверхности и не «дёргается» покадрово. Я гонял ролик с разливающимся напитком, и растекание выглядело честно, без рывков.
Что говорят сами цифры лидерборда
Давайте по строчкам, потому что тут есть нюанс, который маркетинг любит прятать.
В категории text-to-video без звука HappyHorse-1.0 держит первую строчку Artificial Analysis с Elo около 1357, заметно выше Seedance 2.0. В image-to-video без звука картина та же, лидер с большим отрывом. А вот как только включаешь звук, всё становится плотнее: в text-to-video со звуком HappyHorse и Seedance 2.0 от ByteDance идут вровень, разница в один-два пункта Elo, это статистический шум. В image-to-video со звуком Seedance местами даже впереди.
«HappyHorse-1.0 currently leads the Artificial Analysis Text to Video Arena (without audio) with an Elo score of 1357.» — Artificial Analysis, Text to Video Leaderboard
То есть «лидер бенчмарков» это правда, но с уточнением: безоговорочно лидер именно по картинке без звука. Со звуком это паритет с Seedance, а не разгром. Для нас, селлеров, это даже хорошо: товарные ролики чаще идут в монтаж с наложением своей озвучки, так что меня в первую очередь интересует именно картинка.
HappyHorse против родни, грубая табличка
Я держу в голове примерно такую раскладку, под какую задачу кого беру первым:
- детализация предметки, стабильность на движении: HappyHorse 1.0;
- отражения в зеркалах, хроме, воде: HappyHorse 1.0;
- эмоция, крупный план лица: Hailuo;
- премиум-картинка, кино-свет: Veo 3.1;
- динамика, движение камеры: Kling 3.0;
- физика предметов в руках: Wan 2.7;
- UGC «как с телефона», звук в кадре: Seedance 2.0.
Это не значит, что HappyHorse слабее остальных. Просто у каждой модели свой конёк, простите за каламбур. HappyHorse сильна там, где геометрия и поверхности не должны разваливаться.
До девяти героев в одной сцене
Отдельная фишка, которую я недооценил поначалу. У HappyHorse есть режим создания по источникам: подаёшь до девяти картинок-образцов и используешь их как разных персонажей через указатели вроде «character1», «character2». Каждый сохраняет свою внешность через всю сцену.
Для селлера это не абстракция. Групповой ролик, где несколько товаров взаимодействуют, или сюжет с парой моделей и продуктом в руках, раньше это собиралось монтажом из отдельных генераций. Тут можно попробовать одним проходом. Я пока гонял максимум на трёх образцах, до девяти не доводил, так что за стабильность на полном комплекте не поручусь. Но даже на трёх привязка держалась.
Длина, форматы, звук
По характеристикам ролик от 3 до 15 секунд, по умолчанию 5. Качество 720p или 1080p. Форматы все ходовые: 16:9 под горизонталь, 9:16 под Reels и TikTok, 1:1 под Instagram, плюс 4:3 и 3:4.
Звук можно генерировать, можно не генерировать, выбираете под задачу. Я для товарных роликов обычно делаю без звука и накладываю свою музыку с озвучкой на монтаже, так контроля больше. На вход модель ест текст, до девяти картинок-источников и опционально готовое видео для редактирования.
Кстати про редактирование. Есть режим, где готовый ролик правишь текстовой инструкцией: заменить объект, перенести стиль, локальная правка без перегенерации с нуля. На входе принимает видео от 3 до 60 секунд. Я этот режим пока распробовал поверхностно, выглядит удобно, но как оно поведёт себя на реальном товарном ролике с мелкими деталями, надо ещё проверять.
Теперь честно про слабые места
Раз уж я обещал без патриотизма, то и про минусы.
Первое и главное. Модель на момент анонса формально заявлена как открытая, но веса публично не выложены: ссылки на GitHub и Model Hub висели в статусе «скоро». Сама Alibaba говорит, что проект ещё в разработке. Так что относиться к ней как к финальному стабильному продукту я бы пока поостерёгся, она свежая.
Второе. Независимые тесты отмечают, что на длинных роликах непрерывность сцены проседает: чем дальше к концу клипа, тем выше шанс, что логика движения где-то сорвётся. Я это тоже ловил на восьмисекундных генерациях, ближе к концу иногда «подламывается». Для товарной съёмки на 5-6 секунд это почти не мешает, но если задумали длинный сюжет, держите в голове.
Третье, более тонкое. Обозреватели пишут, что у HappyHorse сжатое цветовое пространство, и это бьёт по гибкости на цветокоррекции: меньше запаса в светах, раньше уходят в клиппинг насыщенные красные и циановые. Если вы потом серьёзно крутите грейдинг в Resolve, материал даёт меньше свободы, чем настоящая камера. Мне как раз про это писал наш моушн-дизайнер, я сам в грейдинге не настолько глубоко, так что тут передаю с его слов, возможно в финальной версии модели это подтянут.
И со звуком, как я уже сказал, не та разгромная победа, что в картинке. Звук рабочий, но не выше Seedance.
Сколько это стоит и где брать в РФ
На сторонних площадках тарификация посекундная: $0.14 за секунду в 720p и $0.28 за секунду в 1080p, без минималок и подписок. Десятисекундный ролик в 1080p выходит около $2.80. Но это если у вас есть зарубежная карта и вы готовы возиться с оплатой из России.
У нас во Flami HappyHorse 1.0 лежит в общей подписке, тарификация в рублях, кредитами. Точная цена зависит от длины и качества ролика, актуальные цифры в кабинете. Главное, что не нужно регистрироваться у Alibaba, заводить иностранную карту и воевать с платежами. HappyHorse лежит в одном окне с Veo, Kling, Hailuo и остальными, переключаетесь между моделями под задачу.
Чек-лист: брать ли HappyHorse 1.0
- ✓ Предметная съёмка, где важна детализация и стабильность на движении
- ✓ Нужны честные отражения в зеркале, хроме, стекле, воде
- ✓ Сложная физика: спорт, акробатика, взаимодействие с предметами
- ✓ Несколько разных героев в одной сцене по картинкам-источникам
- ✗ Главное в ролике это эмоция крупным планом, тут сильнее Hailuo
- ✗ Нужен максимально гибкий под грейдинг материал, цветовое пространство сжатое
- ✗ Длинный непрерывный сюжет за один проход, к концу клипа возможны срывы
Что дальше
Хочу отдельно сравнить HappyHorse и Seedance 2.0 на одинаковых товарных промптах со звуком, потому что на лидерборде они вровень, а на глаз разница может быть видна. Ещё в очереди разбор Wan 2.7 и заметка про Grok Imagine. Но это уже другие статьи.
Попробовать HappyHorse 1.0 без VPN и зарубежной карты можно в Flami, на стартовом пакете бесплатно.
Источники
Об авторе
Артём Соколов
Обозреватель Flami
Читайте также
Как видео в карточке поднимает конверсию: разбираю цифры, которым можно верить, и которым нельзя
Как алгоритмы Wildberries и Ozon ранжируют карточки в 2026: что реально двигает товар вверх, а что мифы
Сколько стоит AI-видео против студийной съёмки: посчитал на реальных цифрах для селлера
Сколько стоит карточка товара под ключ на нейросетях: разложил бюджет от нуля