Поиск по сайту
Gemini и ИИ

Xiaomi впервые показала, сколько стоит обучение MiMo-V2.6 на RL

Xiaomi впервые раскрыла детали масштабного обучения MiMo-V2.6 на RL: за час команда потратила больше 200 тысяч рублей на вычисления, а пользователи увидели живой прогресс и внутренние метрики прямо в процессе.

Xiaomi впервые показала, сколько стоит обучение MiMo-V2.6 на RL © androidmag.org
Xiaomi впервые показала, сколько стоит обучение MiMo-V2.6 на RL © androidmag.org

В этот раз Xiaomi не ограничилась анонсом новой AI-модели. Луо Фули, руководительница команды MiMo, открыла публичную страницу, где любой может следить за тем, как идёт RL-обучение MiMo-V2.6. За час вычислений команда потратила 207 200 рублей. Общие расходы на обучение двух версий модели уже перевалили за 1,16 миллиона долларов.

Пользователи получили доступ к панели с ключевыми параметрами: видно, как идёт обучение, сколько токенов обработано, во что обходятся вычисления, сколько сэмплов прошло через модель и как меняются внутренние метрики. Сейчас обучаются две версии - MiMo-V2.6-Pro и MiMo-V2.6-Flash. Pro прошла 12 шагов, обработала 301 000 сэмплов и потратила 806 349 долларов. Flash - 17 шагов, 426 000 сэмплов и 354 499 долларов. Обе версии уже перевалили за 25 и 40 миллиардов токенов соответственно.

По данным NYU Shanghai RITS, обучение MiMo-V2.6 идёт в реальном времени. Финальные веса и технический отчёт пока не опубликованы.

Как Xiaomi масштабирует обучение MiMo-V2.6

Луо Фули выделила три направления масштабирования RL-обучения: вычислительные мощности, разнообразие среды и доработка системы наград. Для одного шага обучения уходит примерно 2 миллиарда токенов, 1568 промптов и 16 параллельных запусков. Это позволяет запускать до 25 000 попыток решения задачи за раз. Такой подход даёт модели шанс сразу тестировать разные стратегии и выбирать, что работает лучше - всё на основе обратной связи.

Второе направление - расширение среды. MiMo-V2.6 учится сразу на нескольких типах задач: визуальных, кодовых, универсальных и чатовых. На панели видны датасеты для работы с изображениями (например, visual/dataset-jz3d, visual/dataset-gtaV), кодом (code/dataset-4qn) и общими задачами. Модель не зацикливается на одной специализации, а учится работать в разных агентных сценариях.

Согласно независимым обзорам, публичный показ RL-тренировки MiMo-V2.6 стартовал 17 сентября 2026 года и стал продолжением открытого релиза MiMo-V2.5, который был в апреле того же года. Такой шаг называют редкостью для индустрии масштабных AI-моделей.

Третье направление - развитие системы оценки. Команда внедрила агентный механизм распределения наград: тест-кейсы и рубрики совмещаются для более точной обратной связи. Для сложных задач с несколькими этапами модель получает разные награды за каждый шаг, что помогает выработать более эффективные стратегии. По данным панели, средние значения наград для обеих версий модели стабильно растут: у Pro - с 0,55 до 0,582, у Flash - с 0,52 до 0,570.

Что показывают метрики и зачем Xiaomi раскрывает процесс

На панели видно не только расходы, но и реальные изменения в способностях MiMo-V2.6. Например, Pro сейчас набирает 63,72 балла на бенчмарке DeepSWE v1.1, Flash - 60,77. Этот тест оценивает навыки программирования и работы с кодом. Ещё один важный показатель - длина контекста: обе версии уже работают с контекстом около 100 000 токенов. Это критично для сложных агентных задач, где нужно помнить длинные цепочки действий и результаты инструментов.

В отличие от большинства компаний, Xiaomi не ограничилась публикацией итоговых баллов и параметров. Впервые открыт сам процесс обучения. Теперь любой может наблюдать, как меняются метрики, растут затраты и как модель постепенно становится сложнее и умнее. Такой подход позволяет видеть, как связаны вложения в вычисления, рост способностей и адаптация к разным средам.

Для сравнения: в других новостях о мобильных технологиях, например, как писали ранее, производители обычно показывают только характеристики и итоговые возможности устройств, не раскрывая внутреннюю кухню разработки.

Открытость Xiaomi в вопросе RL-обучения MiMo-V2.6 - редкость для индустрии, где процессы обычно скрыты. Для пользователей Android это значит, что компания не только вкладывается в развитие AI, но и готова делиться реальными результатами и сложностями масштабирования. Такой уровень прозрачности помогает понять, как формируются современные AI-агенты и почему их обучение требует таких ресурсов. Если Xiaomi продолжит публиковать динамику обучения, пользователи смогут сами оценивать, насколько оправданы вложения и как быстро модель приближается к реальному прорыву в агентных технологиях.