В этот раз Xiaomi не ограничилась анонсом новой AI-модели. Луо Фули, руководительница команды MiMo, открыла публичную страницу, где любой может следить за тем, как идёт RL-обучение MiMo-V2.6. За час вычислений команда потратила 207 200 рублей. Общие расходы на обучение двух версий модели уже перевалили за 1,16 миллиона долларов.
Пользователи получили доступ к панели с ключевыми параметрами: видно, как идёт обучение, сколько токенов обработано, во что обходятся вычисления, сколько сэмплов прошло через модель и как меняются внутренние метрики. Сейчас обучаются две версии - MiMo-V2.6-Pro и MiMo-V2.6-Flash. Pro прошла 12 шагов, обработала 301 000 сэмплов и потратила 806 349 долларов. Flash - 17 шагов, 426 000 сэмплов и 354 499 долларов. Обе версии уже перевалили за 25 и 40 миллиардов токенов соответственно.
По данным NYU Shanghai RITS, обучение MiMo-V2.6 идёт в реальном времени. Финальные веса и технический отчёт пока не опубликованы.
Как Xiaomi масштабирует обучение MiMo-V2.6
Луо Фули выделила три направления масштабирования RL-обучения: вычислительные мощности, разнообразие среды и доработка системы наград. Для одного шага обучения уходит примерно 2 миллиарда токенов, 1568 промптов и 16 параллельных запусков. Это позволяет запускать до 25 000 попыток решения задачи за раз. Такой подход даёт модели шанс сразу тестировать разные стратегии и выбирать, что работает лучше - всё на основе обратной связи.
Второе направление - расширение среды. MiMo-V2.6 учится сразу на нескольких типах задач: визуальных, кодовых, универсальных и чатовых. На панели видны датасеты для работы с изображениями (например, visual/dataset-jz3d, visual/dataset-gtaV), кодом (code/dataset-4qn) и общими задачами. Модель не зацикливается на одной специализации, а учится работать в разных агентных сценариях.
Согласно независимым обзорам, публичный показ RL-тренировки MiMo-V2.6 стартовал 17 сентября 2026 года и стал продолжением открытого релиза MiMo-V2.5, который был в апреле того же года. Такой шаг называют редкостью для индустрии масштабных AI-моделей.
Третье направление - развитие системы оценки. Команда внедрила агентный механизм распределения наград: тест-кейсы и рубрики совмещаются для более точной обратной связи. Для сложных задач с несколькими этапами модель получает разные награды за каждый шаг, что помогает выработать более эффективные стратегии. По данным панели, средние значения наград для обеих версий модели стабильно растут: у Pro - с 0,55 до 0,582, у Flash - с 0,52 до 0,570.
Что показывают метрики и зачем Xiaomi раскрывает процесс
На панели видно не только расходы, но и реальные изменения в способностях MiMo-V2.6. Например, Pro сейчас набирает 63,72 балла на бенчмарке DeepSWE v1.1, Flash - 60,77. Этот тест оценивает навыки программирования и работы с кодом. Ещё один важный показатель - длина контекста: обе версии уже работают с контекстом около 100 000 токенов. Это критично для сложных агентных задач, где нужно помнить длинные цепочки действий и результаты инструментов.
В отличие от большинства компаний, Xiaomi не ограничилась публикацией итоговых баллов и параметров. Впервые открыт сам процесс обучения. Теперь любой может наблюдать, как меняются метрики, растут затраты и как модель постепенно становится сложнее и умнее. Такой подход позволяет видеть, как связаны вложения в вычисления, рост способностей и адаптация к разным средам.
Для сравнения: в других новостях о мобильных технологиях, например, как писали ранее, производители обычно показывают только характеристики и итоговые возможности устройств, не раскрывая внутреннюю кухню разработки.
Открытость Xiaomi в вопросе RL-обучения MiMo-V2.6 - редкость для индустрии, где процессы обычно скрыты. Для пользователей Android это значит, что компания не только вкладывается в развитие AI, но и готова делиться реальными результатами и сложностями масштабирования. Такой уровень прозрачности помогает понять, как формируются современные AI-агенты и почему их обучение требует таких ресурсов. Если Xiaomi продолжит публиковать динамику обучения, пользователи смогут сами оценивать, насколько оправданы вложения и как быстро модель приближается к реальному прорыву в агентных технологиях.