Модели Microsoft MAI в 2026: что реально доступно и почём

15 мин чтения
Stanislav Belyaev
Stanislav Belyaev Engineering Leader в Microsoft
Модели Microsoft MAI в 2026: что реально доступно и почём

Второго июня на Build 2026 Microsoft показала семь собственных моделей под маркой MAI (Microsoft AI): рассуждение, код, изображения, голос, расшифровка записей. Компания, которая годами была крупнейшим инвестором OpenAI, назвала это переходом к «долгосрочной самодостаточности».

Microsoft AI main page

Менеджеру из этого анонса важны две вещи. Первая – цены: час записанной встречи расшифровывают за $0,10, и контракт с Azure для этого не нужен. Вторая – Frontier Tuning, дообучение модели на ваших собственных рабочих процессах внутри вашего же контура соответствия. Это самая сильная идея, которую Microsoft выпустила за год, и российская компания купить её не может.

С доступом из России разберёмся сразу, потом перейдём к моделям и цифрам.

Сначала о доступе из России

Microsoft отключила российских корпоративных заказчиков от облачных сервисов Azure – в исполнение двенадцатого пакета санкций ЕС от декабря 2023 года, который запрещает поставлять зарегистрированным в России организациям корпоративное ПО и облачные решения. Для российского бизнеса закрыли около 50 облачных сервисов.

Про ограничения для физических лиц сообщений нет: частный доступ пока сохраняется.

Практическое следствие простое. Microsoft Foundry и Frontier Tuning – вся корпоративная часть истории MAI – для российской компании не покупаются. Доступным остаётся OpenRouter с моделями изображений, голоса и расшифровки по опубликованным ценам, плюс GitHub Copilot с кодовой моделью. Пошаговых инструкций по настройке Foundry в этой статье сознательно нет: российскому менеджеру они не принесли бы ничего.

Семь моделей, собранных «с нуля»

Microsoft упирает на происхождение: «Мы не дистиллируем из других лабораторий и не опираемся на непрозрачные данные». Архитектуру, конвейер обучения и постобучение компания, по её словам, построила сама, а модели со-проектировала с собственным чипом Maia 200 – это дало выигрыш в эффективности в 1,4 раза. MAI-Thinking-1 обучали с нуля на чистых коммерчески лицензированных данных, без дистилляции из OpenAI и любых других семейств.

Для корпоративного покупателя с требованиями комплаенса к происхождению данных это и есть главное продуктовое отличие. Бенчмарк здесь вторичен: цифры качества проверяет кто угодно, а происхождение весов – только поставщик.

В прошлом году мы писали, что Microsoft тихо выиграла корпоративный рынок ИИ – теперь эта линия поведения привела к собственной линейке моделей:

МодельЧто этоКлючевые числа
MAI-Thinking-1Флагманская модель рассужденияРазреженный MoE: активны 35 млрд параметров из примерно триллиона; контекст 256 тыс., ответ до 64 тыс. токенов, только текст
MAI-Code-1-FlashМодель для агентного кода5 млрд активных параметров, контекстное окно 256 тыс. токенов
MAI-Image-2.6Генерация и редактирование изображенийЕсть Flash-вариант для дешёвой массовой работы
MAI-Transcribe-2Распознавание речи60 языков, доменная терминология
MAI-Voice-2Синтез речи15 языков, адаптация голоса по короткому образцу, защита от злоупотреблений

Десять центов за час записи

То, что можно пойти и использовать сегодня, лежит на OpenRouter – агрегаторе моделей с опубликованными ценами, без корпоративного контракта. Вот что выставлено там:

  • microsoft/mai-transcribe-2$0,10 за час аудио, 60 языков. Прошлая версия, mai-transcribe-1.5, стоит $0,36 за час – новая в 3,6 раза дешевле.
  • microsoft/mai-voice-2 – $22 за 1 млн символов, flash-вариант – $15.
  • microsoft/mai-image-2.6 – $5 за 1 млн, flash – $1,75; версии 2.5 и 2.5-pro – по $5 за 1 млн.
  • microsoft/mai-ds-r1 – контекст 164 тыс. токенов, цена не указана.

Час записанного совещания за десять центов – самое полезное число во всём анонсе MAI. Сама Microsoft называет MAI-Transcribe-2 «самой быстрой, точной и дешёвой моделью распознавания речи в мире» и заявляет пятикратный выигрыш в скорости у конкурентов. Как всегда с заявлениями вендора, точность стоит проверить на своих записях – но цена реальная и опубликованная, и маршрут к ней не требует согласований с юристами и закупками.

Расклад в линейке показателен. Флагманская модель рассуждения – превью без опубликованной цены, а пригодная к работе сегодня вещь – модель расшифровки, про которую не пишут заголовков. Рабочей оказалась скучная часть линейки MAI.

Цены и маршруты доступа – знание, которое устаревает за месяцы. Решение о том, какой модели отдать какую задачу и сколько бюджета на это заложить, – навык, и он держится дольше любого прайс-листа.

Десять центов за час записи – это цена. Вопрос в том, что вы поручите модели за эти деньги. Попробуйте ИИ на 9 реальных задачах менеджера – бесплатно, без регистрации.

Доступ сразу после регистрации

Начать обучение

40 минут русского совещания через три модели

Microsoft заявляет для MAI-Transcribe-2 первое место на FLEURS: средний WER 5,2% на 60 языках. Отдельной цифры по русскому языку компания не публикует вообще. На странице модели есть 3,4% для топ-25 языков – то есть разброс внутри набора большой, и куда в нём попадает русский, неизвестно.

Средний показатель при этом вырос с 3,7% у MAI-Transcribe-1.5 на 43 языках. Причина в составе набора: в него добавили 17 языков с малым объёмом данных, и среднее считается теперь по более трудному материалу. Сам FLEURS – начитанная речь: носители читают около 2 000 подготовленных предложений. Совещание с перебиваниями, шумом и проверкой микрофонов звучит иначе.

Для сравнения: ElevenLabs публикует WER 3,1% именно по русскому на FLEURS. Microsoft – ничего. На доске Artificial Analysis по WER MAI-Transcribe-2 вторая, за Alibaba Fun-Realtime-ASR. Лидерство Microsoft заявляет по скорости и цене, по точности – нет.

Поэтому мы прогнали через три модели одну и ту же запись: открытую встречу сообщества казахстанских тимлидов «Тимлид не кодит» от 3 июня 2026 года. 39,6 минуты разговорного русского, несколько участников, в начале проверка микрофонов, темы – серверный полигон, переезд с Telegram на Discord, культура найма. Запись публичная, поэтому цифры ниже можно перепроверить. MAI-Transcribe-2 запускали через OpenRouter (microsoft/mai-transcribe-2) – маршрут, который работает без контракта с Azure, так что цифры получены на пути, доступном читателю. Модель доступна и в Azure Speech в статусе preview, но этот второй маршрут упирается в ту же проблему с доступом из России, о которой статья говорит в начале.

Три модели на одной записи: время 15,8 против 88,6 и 62,9 секунды; символов 26,7 против 25,8 и 21,9 тысячи; точек 578 против 331 и нуля

MAI быстрее Gemini в 5,6 раза и Yandex в 4 раза: 39,6 минуты аудио за 15,8 секунды, четыре фрагмента параллельно – примерно в 150 раз быстрее реального времени. Заявление Microsoft про скорость на реальном аудио подтвердилось.

У Yandex пунктуации нет вообще: ноль точек, ноль запятых, одна строка на 21 910 символов. Для протокола встречи это означает обязательную вторую обработку.

MAI сохраняет заполнители речи: «э-э» встречается в расшифровке 54 раза, у остальных моделей ноль. У модели есть режимы verbatim и clean – для стенограммы нужен первый, для протокола второй.

Расхождения, которые видно в тексте

Начало записи, та самая проверка микрофонов:

МодельРасшифровка
MAI-Transcribe-2«Добрый вечер. Так. А сейчас какой-то шум от меня хотя бы идёт. О, сейчас пошло. А, так, так, так, спикерс.»
Gemini 3.5 Flash«Добрый вечер. Так. А сейчас какой-то шум от меня хотя бы идёт? О, сейчас пошло. А-а, так-так-так, спикером…»
Yandex SpeechKit«Добрый вечер Так А сейчас какой то шум от меня хотя бы идет вова сейчас пошла а А так так так спикер с»

Yandex превратил междометие «О,» в имя «вова» и согласовал с ним глагол по роду. Он же потерял имя «Арам», которое расслышали обе другие модели.

Самый серьёзный случай – инверсия смысла в середине записи:

МодельРасшифровка
MAI-Transcribe-2«…музыку-то слышал. Мне интересно. Похоже, т- техника как бы, которая… всё портит.»
Gemini 3.5 Flash«…музыку-то слышал? Мне интересно. Похоже тут техника как бы, которая всё портит.»
Yandex SpeechKit«…музыку то слышал Не интересно. Покажите техника как бы которая Все портит»

Две ошибки в одном предложении, и обе меняют смысл на противоположный: «Мне интересно» стало «Не интересно», «Похоже» стало «Покажите». В протоколе встречи это уже другое утверждение – и его кто-то подпишет.

Послушать самому

Проверка микрофонов – лёгкий случай. Возьмём середину встречи, где идёт рабочий разговор: с 10:55 по 11:55 участники обсуждают переезд сообщества из Telegram в Discord и раздачу прав в каналах. Включите и переключите вкладки – под каждой моделью её расшифровка ровно этой минуты, дословно.

Что вернула модель
О, мы можем в Телеграм этот отправлять, сводку вот эту, да? Типа Да, кто хочет сводку отправлять. Да, а де- детали, короче, то типа лезь в Дискорд. Да. Э-э, вот, э-э, м- тяжи- ну как бы, я, я, мы вот попробовали же тогда, в принципе, в Discord мало кто пришёл. То есть мне Discord, я думаю, Discord – это правильное решение для построения комьюнити, потому что он чуть более там, э-э, много разных, э-э, и прав давать можно, можно людям давать какие-то, ну, знаешь, там, кто хочет вести какое-то своё направление, можно ему там канальчик дать или там, или какие-то лычку, или ещё что-то.

Название узнано везде, но записано по-разному: сначала кириллицей «Дискорд», дальше латиницей «Discord». Внутри одной минуты.

Что вернула модель
О, мы можем в Telegram этот отправлять, сводку вот эту, да? Типа, кто хочет, Да, сводку отправлять. Да, а детали, короче, кто типа лезет в Discord. Да, э, вот, э, ти-, ну как бы я я, мы вот попробовали же тогда, в принципе, в Discord мало кто пришёл. То есть мне Discord, я думаю, Discord - это правильное решение для построения комьюнити, потому что, э, он чуть более там много разных и прав давать можно, можно людям давать какие-то, ну, знаешь, там, кто хочет вести какую-то своё направление, можно ему там канальчик дать или там или какие-то лычку или ещё что-то.

Оба названия латиницей и одинаково во всех четырёх случаях.

Что вернула модель
О мы можем в телеграмм этот отправлять сводку вот эту да да детали короче то типа лесики скорбь да вот Ну я я мы вот попробовали же тогда в принципе без слов мало кто пришел то то есть не диспорт я думаю диспорт это правильное решение для построения комьюнити потому что он чуть более там много разных и прав давать можно можно людям давать какие то ну знаешь что кто хочет вести какое то свое направление можно его там канальчик дать или там или какие то лычку или еще что то

Слово Discord не появилось ни разу. Вместо него «лесики скорбь», «без слов» и дважды «диспорт» – четыре попытки, четыре промаха.

Фрагмент публичной записи встречи «Тимлид не кодит» от 3 июня 2026 года, сообщество казахстанских тимлидов. Тире и дефисы внутри расшифровок – такие, какими их вернули модели.

Названия продуктов проверяются глазом за секунду, и в этом смысле такая ошибка безопаснее инверсии смысла. Хуже другое: «в принципе без слов мало кто пришёл» читается как законченная фраза, и в протоколе её никто не пометит.

Здесь же видна разница режимов verbatim и clean. MAI сохранил запинку «т- техника», Gemini сгладил её до «тут техника», добавив слово, которого в записи не было. Вывод «Gemini точнее» отсюда не следует: режимы разные, и для стенограммы сглаженный хуже.

Третье расхождение – пропавший целиком фрагмент. У MAI есть: «Мо- может кто-то поговорить, э-э, просто так, чтобы… Раз-раз. Ну, раз-раз я слышу. О, ну всё хорошо тогда, хоть что-то слышат.» У Gemini и Yandex фрагмента «раз-раз» нет – обе модели пропустили его.

Чего тест не показывает

  • WER мы не измеряли: эталонной расшифровки записи нет, сравнение качественное.
  • Отраслевую терминологию проверить не удалось – в записи её не было. Именно там работает keyword biasing у MAI, и именно это осталось непроверенным.
  • Одна запись, один домен, одна акустика. Это проверка перед покупкой; бенчмарком её назвать нельзя.

Русские сервисы на русском аудио

Если нужен именно русский протокол, есть альтернативы, которые тестируют на русском аудио. Обзор лучших API для распознавания речи на Habr, февраль 2026, даёт такой WER:

  • Nexara – 0,391 при 360 ₽ за 1000 минут
  • Palatine – 0,414
  • Shopot – 0,444
  • Sber API – 0,448
  • Yandex SpeechKit – 0,550, последнее место

Российские стартапы точнее Яндекса и Сбера. Для менеджера, которому нужен русский протокол, это реальная альтернатива.

Итог один: проверьте модель на своей записи до того, как закладывать её в процесс. У Microsoft самая быстрая транскрипция и самая низкая цена, по русскому языку – ни одной опубликованной цифры, а на нашей записи MAI-Transcribe-2 дала лучший результат по пунктуации и структуре. Этого достаточно, чтобы протестировать. Чтобы покупать не глядя – нет.

MAI-Thinking-1: превью с опубликованной ценой

Флагман лежит в каталоге моделей Microsoft Foundry в статусе превью, но тарифы Microsoft опубликовала сразу: $2 за миллион входных токенов и $8 за миллион выходных [Microsoft Foundry blog].

Для сравнения по той же таблице цен: Sonnet 4.6 стоит $3 и $15, то есть на выходе MAI-Thinking-1 почти вдвое дешевле. Микс входа и выхода у рассуждающей модели смещён в сторону выхода, поэтому разница в счёте будет ближе к двукратной, чем к полуторной.

Цена в прайс-листе и доступ к модели – разные вещи. Квоты на превью выдают скупо: запросы к MAI-Thinking-1 регулярно упираются в нехватку квоты, и «модель есть в каталоге» не означает, что она посчитает вашу задачу сегодня. Планировать на ней рабочий процесс рано.

По карточке модели: контекстное окно 256 тыс. токенов, потолок ответа 64 тыс. токенов, вход и выход только текстовые, хостинг – Azure. Картинки и звук она не принимает, то есть на задачах со скриншотами и записями встреч она не работает вовсе.

Гарантии проживания данных зависят от региона Azure, а региональное покрытие на момент запуска ещё разворачивалось.

Заявления о качестве – тоже собственные слова Microsoft. По их данным, MAI-Thinking-1 совпадает с Opus 4.6 на SWE-Bench Pro, а в слепой человеческой оценке оказалась предпочтительнее Sonnet 4.6. MAI-Code-1-Flash приписывают до 60% меньший расход токенов, чем у Haiku 4.5, на кодовых бенчмарках при более высокой точности. Независимых подтверждений этим сравнениям пока нет, ни одной модели MAI в нашем бенчмарке тоже нет. О том, как читать такие заявления, у нас есть отдельный разбор: Бенчмарки ИИ теряют смысл – как тогда выбирать модель.

MAI-Code-1-Flash: цена, которую нельзя заплатить

За кодовой моделью сообщают тарифы $0,75 за миллион входных токенов и $4,50 за миллион выходных, кэш входа – $0,075. Это в точности цифры GPT-5.4 Mini.

Сообщать их стоит вместе с оговоркой: публичной точки доступа и листинга в Azure AI Foundry у модели нет, а её карточка говорит, что цена «будет определена». То есть эти тарифы описывают внутренний учёт токенов внутри Copilot. API, где по ним можно заплатить, не существует.

Реально модель доступна в GitHub Copilot и VS Code: запросы маршрутизируются на MAI-Code-1-Flash автоматически, и это работает на всех тарифах, от Free до Max; версия для CLI в планах. Для читателя из России это второй после OpenRouter доступный маршрут в линейку MAI.

Frontier Tuning: обучение внутри вашего периметра

Главное по-настоящему новое в анонсе. Обычный файн-тюнинг – работа по документам: вы отдаёте корпус текстов и получаете модель, которая знает вашу терминологию. Frontier Tuning устроен иначе: обучение с подкреплением идёт внутри собственного контура соответствия заказчика, а модель учится на реальных следах рабочего процесса – цепочках инструментов, решениях и их исходах. Microsoft называет эти среды обучения с подкреплением «тренажёрными залами для ИИ»; данные не покидают среду заказчика. Впервые на этой платформе разработчикам разрешили настраивать сами веса.

О том, что среды обучения дают руководителю уже сейчас, мы подробно писали: Среды обучения ИИ: управленческие инсайты на $1 млрд.

Результаты Frontier Tuning – пока слова вендора и партнёров:

  • В собственном HR-внедрении Microsoft доля выполненных задач выросла с 13% до 87% после дообучения.
  • MAI-модель, настроенная под Excel, соответствует GPT-5.4 при эффективности выше вплоть до 10 раз.
  • McKinsey сообщает о самом высоком винрейте среди всех протестированных моделей примерно при 10-кратной разнице в стоимости.

Утверждение, которое стоит вынести отсюда менеджеру: небольшая модель, заточенная под ваш рабочий процесс, бьёт универсальный флагман при кратно меньшей цене. Сама арифметика не нова – мы видели её на рынке из 53 моделей: 99% качества за 1,4% цены.

Вторая половина правды в том, что Frontier Tuning – это ещё и аргумент купить весь стек Microsoft: Foundry, Copilot Studio, чипы Maia, работу Forward Deployed Engineers. Сильная идея продаётся здесь только в комплекте с экосистемой, и для российской компании она закрыта вместе с Azure. Следить за направлением всё равно стоит: то же движение видно и у других вендоров, а если данные вообще нельзя отправлять наружу, ответом становится собственное железо – Локальные LLM для менеджера.

В ту же корпоративную логику ложится кейс Mayo Clinic: фронтир-модель для медицины строят на экспертизе клиники и её обезличенных клинических данных, сначала разворачивают внутри Mayo, позже обещают в Foundry. Важно здесь условие договора – Mayo сохраняет право собственности на модель. Для любого отраслевого лидера это шаблон: как создавать модель вместе с платформой и не отдать ей свой актив.

Куда идти за доступом

Все маршруты, от самых доступных читателю из России к недоступным:

МаршрутЧто даётРеальность
OpenRouterМодели изображений, голоса и расшифровки, опубликованные ценыКонтракт с Azure не нужен – единственный маршрут, работающий без корпоративных отношений
GitHub Copilot / VS CodeMAI-Code-1-Flash, автоматическая маршрутизацияТарифы от Free до Max; CLI-версия в планах
Fireworks, BasetenMAI-Thinking-1Сторонний хостинг
Microsoft FoundryВся линейка, оценка, безопасность, наблюдаемость, Frontier TuningДля российских юрлиц закрыт
Copilot Studio / Forward Deployed EngineersПроекты Frontier TuningПрямой контракт, только enterprise

Ни одной модели MAI в нашем бенчмарке пока нет; что в нём есть и как сравнивать протестированные модели между собой – в хабе серии Сравнение GenAI инструментов 2026.

Как это применить в работе

  • Запишите ближайшую встречу и прогоните звук через MAI-Transcribe-2 на OpenRouter: час стоит $0,10. Сравните с тем, что платите за расшифровку сейчас и как часто расшифровка теряет терминологию вашей предметной области.
  • Если команда уже платит за GitHub Copilot, посмотрите, на какую модель уходят ваши типовые задачи и меняется ли качество, когда маршрутизация выбирает MAI-Code-1-Flash.
  • Не закладывайте в бюджет Foundry, если компания зарегистрирована в России. Вместо этого следите за аналогами настройки на рабочих процессах у вендоров, которые вам доступны.

Microsoft годами была крупнейшим инвестором OpenAI и пришла к мысли, неудобной для всего фронтирного рынка: настроенная маленькая модель даёт тот же результат за десятую часть цены. Продаёт компания эту мысль только вместе со своим облаком, своим железом и своими инженерами. А часть, доступная российскому менеджеру сегодня, – час записи за десять центов.

Вопрос здесь уже не про Microsoft. Если дообучение под процесс действительно снимает кратно меньшую цену при том же результате, как долго вообще продержится прайс-лист флагманов – и кто из доступных нам вендоров ответит на это первым?

Специализация

Цены на токены меняются. Навык выбора модели – остаётся

Специализация по проектному управлению: 10 уроков, каждый из которых строит переиспользуемый шаблон для вашей ежедневной работы.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader в Microsoft

18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.