29 июля 2026 года команда VS Code опубликовала производственные метрики MAI-Code-1-Flash в GitHub Copilot Chat. Лёгкая модель Microsoft обошла Claude Haiku 4.5 и GPT-5.4 Mini по сохранению сгенерированного кода, тогда как более крупные модели потребовали на 67–94% больше токенов за один диалоговый ход.

MAI-Code-1-Flash удерживает больше кода, чем лёгкие конкуренты
От компактной модели обычно ждут ощутимого компромисса в качестве. Свежие данные VS Code рисуют более интересную картину: MAI-Code-1-Flash показала лучшие результаты, чем Claude Haiku 4.5 и GPT-5.4 Mini, по трём метрикам, связанным с реальным использованием сгенерированного кода.
Команда собрала агрегированные данные пользователей, которые самостоятельно выбирали модели в VS Code Copilot Chat с 2 июня по 24 июля 2026 года. Результаты опубликовали 29 июля в официальном блоге VS Code.
Все показатели приведены относительно MAI-Code-1-Flash, принятой за базовый уровень:
| Модель | Код сохранился после редактирования | Код дошёл до коммита | Предложения приняты | Токенов за ход | Ходов до коммита |
| MAI-Code-1-Flash | Базовый уровень | Базовый уровень | Базовый уровень | Базовый уровень | Базовый уровень |
| Claude Haiku 4.5 | −2% | −8% | −10% | −10% | +28% |
| GPT-5.4 Mini | −3% | −8% | −7% | +7% | +17% |
| GPT-5.6 Luna | +3% | +3% | +4% | +67% | +17% |
| Kimi K2.7 Code | +4% | +6% | −6% | +94% | +11% |
Claude Haiku 4.5 генерировала примерно на 10% меньше токенов за ход, при этом пользователям требовалось на 28% больше ходов, чтобы дойти до Git-коммита. GPT-5.4 Mini уступила базовой модели по сохранению кода и расходовала на 7% больше токенов.
VS Code измерял код, который пережил правки и дошёл до коммита
Обычная кнопка принятия подсказки показывает лишь первую реакцию разработчика. Код может выглядеть удачно в момент генерации, а через несколько минут исчезнуть после запуска тестов, чтения соседних файлов или ручной доработки.
Поэтому команда VS Code использовала несколько связанных показателей:
- Code survival rate — доля сгенерированного кода, которая осталась в файле после десяти минут активного редактирования.
- Commit survival rate — доля кода, сохранившаяся к моменту Git-коммита.
- Accept rate — доля предложений, которые пользователь принял.
- Tokens per turn — медианное число токенов в одном обмене запросом и ответом.
- Turns per commit — медианное число обращений к модели до создания коммита.
Такая методика приближает оценку к рабочему процессу. Для команды важен код, который выдержал проверку и попал в репозиторий, поскольку мгновенное принятие подсказки ещё не говорит о её долговечности.
Крупные модели дают несколько процентов качества при росте расхода до 94%
GPT-5.6 Luna опередила MAI-Code-1-Flash на 3% по сохранению кода после редактирования и на 3% по сохранению к моменту коммита. Её расход токенов оказался выше на 67%, а путь до коммита потребовал на 17% больше диалоговых ходов.
Kimi K2.7 Code показала самый высокий результат по сохранению кода: +4% после редактирования и +6% у коммита. Одновременно модель получила на 6% более низкий показатель принятия предложений, расходовала на 94% больше токенов за ход и требовала на 11% больше обращений до коммита.
Разница хорошо показывает роль MAI-Code-1-Flash внутри Copilot. Для исследования незнакомого участка проекта, небольшого исправления, генерации теста или последовательной серии локальных правок модель старается быстрее привести пользователя к устойчивому результату. Задачи с глубоким архитектурным анализом могут оправдать выбор более крупной модели, когда несколько дополнительных процентов качества ценнее расхода лимита.
A/B-тест Auto подтвердил более частое возвращение пользователей
Самостоятельный выбор модели создаёт погрешность: разные группы пользователей решают разные задачи и заранее предпочитают определённые инструменты. VS Code дополнительно провёл A/B-тест через режим Auto, который назначал модель автоматически.
В этом эксперименте пользователи MAI-Code-1-Flash на 6% чаще возвращались в течение двух дней по сравнению с GPT-5.4 Mini и на 11% чаще по сравнению с Claude Haiku 4.5. Через четыре дня повторное использование конкурентов было ниже на 13% и 37% соответственно.
Общий расход токенов у GPT-5.4 Mini оказался на 13% выше, у Claude Haiku 4.5 — на 11% выше. Для Claude команда зафиксировала ещё и на 5% меньше пользовательских обращений. У GPT-5.4 Mini статистически значимой разницы по числу обращений не обнаружили.
Эти цифры не раскрывают, почему конкретный человек вернулся к инструменту. Они показывают более узкий результат: в контролируемом распределении моделей MAI-Code-1-Flash поддерживала более высокую повторную активность при меньшем суммарном расходе токенов.
MAI-Code-1-Flash рассчитана на правки, тесты и исправление ошибок
Microsoft создала MAI-Code-1-Flash специально для связки с агентной инфраструктурой VS Code. Модель ориентирована на быстрые итерации: изучение кода, небольшие изменения, генерацию и улучшение тестов, поиск ошибок и последовательное исправление нескольких файлов.
Длина ответа подстраивается под задачу. Простой запрос получает компактное решение, а многошаговая работа запускает более подробное рассуждение и использование инструментов редактора. Такой режим влияет сразу на скорость ответа и расход лимита Copilot.
По данным Microsoft, модель обучена с нуля на проверяемых данных без дистилляции сторонних моделей. Для дальнейшего улучшения компания использует агрегированные сигналы потребительских тарифов. Данные клиентов Copilot Business и Copilot Enterprise в обучение MAI-Code-1-Flash не входят.
Модель уже доступна в GitHub Copilot и выбирается через меню моделей в поддерживаемых интерфейсах, включая VS Code. Для разработчика практический сценарий выглядит просто: MAI-Code-1-Flash подходит для частых коротких циклов «запрос — правка — тест — коммит», где стоимость каждого дополнительного обращения быстро накапливается.
Результаты относятся к Copilot Chat и требуют осторожного сравнения
Опубликованные цифры принадлежат команде VS Code и отражают работу моделей внутри конкретной агентной инфраструктуры. Они не являются независимым рейтингом универсальных способностей и не показывают абсолютные значения метрик: MAI-Code-1-Flash обозначена как базовый уровень, а остальные результаты выражены через относительную разницу.
В первой части исследования пользователи выбирали модели самостоятельно. A/B-тест Auto уменьшает влияние этого фактора, хотя публикация не раскрывает распределение задач, языков программирования, размеров проектов и длительности сессий. Отдельных данных о задержке ответа и фактической цене одной завершённой задачи тоже нет.
Вывод относится к реальным сценариям VS Code Copilot Chat: MAI-Code-1-Flash заняла сильную позицию среди лёгких моделей и приблизилась к более крупным решениям по сохранению кода при заметно меньшем расходе токенов.
Microsoft готовит более крупные MAI-модели для сложных задач
Публикация от 29 июля переносит обсуждение MAI-Code-1-Flash с уровня обещаний на уровень реальных достижений. Модель уже демонстрирует свою специализацию: она эффективна для быстрых итеративных задач, где разработчик многократно взаимодействует с агентом и контролирует расход лимита.
Microsoft планирует расширить семейство более крупными моделями MAI до конца 2026 года. Их заявленная цель связана со сложными задачами, глубоким рассуждением и конкуренцией с передовыми кодовыми моделями. Главная интрига теперь состоит в том, сохранит ли новое семейство эффективность Flash при росте качества и сложности выполняемой работы.