VS Code показал результаты MAI-Code-1-Flash — сильное качество при меньшем расходе токенов

29 июля 2026 года команда VS Code опубликовала производственные метрики MAI-Code-1-Flash в GitHub Copilot Chat. Лёгкая модель Microsoft обошла Claude Haiku 4.5 и GPT-5.4 Mini по сохранению сгенерированного кода, тогда как более крупные модели потребовали на 67–94% больше токенов за один диалоговый ход.

VS Code показал результаты MAI-Code-1-Flash
VS Code показал результаты MAI-Code-1-Flash

MAI-Code-1-Flash удерживает больше кода, чем лёгкие конкуренты

От компактной модели обычно ждут ощутимого компромисса в качестве. Свежие данные VS Code рисуют более интересную картину: MAI-Code-1-Flash показала лучшие результаты, чем Claude Haiku 4.5 и GPT-5.4 Mini, по трём метрикам, связанным с реальным использованием сгенерированного кода.

Команда собрала агрегированные данные пользователей, которые самостоятельно выбирали модели в VS Code Copilot Chat с 2 июня по 24 июля 2026 года. Результаты опубликовали 29 июля в официальном блоге VS Code.

Все показатели приведены относительно MAI-Code-1-Flash, принятой за базовый уровень:

МодельКод сохранился после редактированияКод дошёл до коммитаПредложения принятыТокенов за ходХодов до коммита
MAI-Code-1-FlashБазовый уровеньБазовый уровеньБазовый уровеньБазовый уровеньБазовый уровень
Claude Haiku 4.5−2%−8%−10%−10%+28%
GPT-5.4 Mini−3%−8%−7%+7%+17%
GPT-5.6 Luna+3%+3%+4%+67%+17%
Kimi K2.7 Code+4%+6%−6%+94%+11%

Claude Haiku 4.5 генерировала примерно на 10% меньше токенов за ход, при этом пользователям требовалось на 28% больше ходов, чтобы дойти до Git-коммита. GPT-5.4 Mini уступила базовой модели по сохранению кода и расходовала на 7% больше токенов.

VS Code измерял код, который пережил правки и дошёл до коммита

Обычная кнопка принятия подсказки показывает лишь первую реакцию разработчика. Код может выглядеть удачно в момент генерации, а через несколько минут исчезнуть после запуска тестов, чтения соседних файлов или ручной доработки.

Поэтому команда VS Code использовала несколько связанных показателей:

  • Code survival rate — доля сгенерированного кода, которая осталась в файле после десяти минут активного редактирования.
  • Commit survival rate — доля кода, сохранившаяся к моменту Git-коммита.
  • Accept rate — доля предложений, которые пользователь принял.
  • Tokens per turn — медианное число токенов в одном обмене запросом и ответом.
  • Turns per commit — медианное число обращений к модели до создания коммита.

Такая методика приближает оценку к рабочему процессу. Для команды важен код, который выдержал проверку и попал в репозиторий, поскольку мгновенное принятие подсказки ещё не говорит о её долговечности.

Крупные модели дают несколько процентов качества при росте расхода до 94%

GPT-5.6 Luna опередила MAI-Code-1-Flash на 3% по сохранению кода после редактирования и на 3% по сохранению к моменту коммита. Её расход токенов оказался выше на 67%, а путь до коммита потребовал на 17% больше диалоговых ходов.

Kimi K2.7 Code показала самый высокий результат по сохранению кода: +4% после редактирования и +6% у коммита. Одновременно модель получила на 6% более низкий показатель принятия предложений, расходовала на 94% больше токенов за ход и требовала на 11% больше обращений до коммита.

Разница хорошо показывает роль MAI-Code-1-Flash внутри Copilot. Для исследования незнакомого участка проекта, небольшого исправления, генерации теста или последовательной серии локальных правок модель старается быстрее привести пользователя к устойчивому результату. Задачи с глубоким архитектурным анализом могут оправдать выбор более крупной модели, когда несколько дополнительных процентов качества ценнее расхода лимита.

A/B-тест Auto подтвердил более частое возвращение пользователей

Самостоятельный выбор модели создаёт погрешность: разные группы пользователей решают разные задачи и заранее предпочитают определённые инструменты. VS Code дополнительно провёл A/B-тест через режим Auto, который назначал модель автоматически.

В этом эксперименте пользователи MAI-Code-1-Flash на 6% чаще возвращались в течение двух дней по сравнению с GPT-5.4 Mini и на 11% чаще по сравнению с Claude Haiku 4.5. Через четыре дня повторное использование конкурентов было ниже на 13% и 37% соответственно.

Общий расход токенов у GPT-5.4 Mini оказался на 13% выше, у Claude Haiku 4.5 — на 11% выше. Для Claude команда зафиксировала ещё и на 5% меньше пользовательских обращений. У GPT-5.4 Mini статистически значимой разницы по числу обращений не обнаружили.

Эти цифры не раскрывают, почему конкретный человек вернулся к инструменту. Они показывают более узкий результат: в контролируемом распределении моделей MAI-Code-1-Flash поддерживала более высокую повторную активность при меньшем суммарном расходе токенов.

MAI-Code-1-Flash рассчитана на правки, тесты и исправление ошибок

Microsoft создала MAI-Code-1-Flash специально для связки с агентной инфраструктурой VS Code. Модель ориентирована на быстрые итерации: изучение кода, небольшие изменения, генерацию и улучшение тестов, поиск ошибок и последовательное исправление нескольких файлов.

Длина ответа подстраивается под задачу. Простой запрос получает компактное решение, а многошаговая работа запускает более подробное рассуждение и использование инструментов редактора. Такой режим влияет сразу на скорость ответа и расход лимита Copilot.

По данным Microsoft, модель обучена с нуля на проверяемых данных без дистилляции сторонних моделей. Для дальнейшего улучшения компания использует агрегированные сигналы потребительских тарифов. Данные клиентов Copilot Business и Copilot Enterprise в обучение MAI-Code-1-Flash не входят.

Модель уже доступна в GitHub Copilot и выбирается через меню моделей в поддерживаемых интерфейсах, включая VS Code. Для разработчика практический сценарий выглядит просто: MAI-Code-1-Flash подходит для частых коротких циклов «запрос — правка — тест — коммит», где стоимость каждого дополнительного обращения быстро накапливается.

Результаты относятся к Copilot Chat и требуют осторожного сравнения

Опубликованные цифры принадлежат команде VS Code и отражают работу моделей внутри конкретной агентной инфраструктуры. Они не являются независимым рейтингом универсальных способностей и не показывают абсолютные значения метрик: MAI-Code-1-Flash обозначена как базовый уровень, а остальные результаты выражены через относительную разницу.

В первой части исследования пользователи выбирали модели самостоятельно. A/B-тест Auto уменьшает влияние этого фактора, хотя публикация не раскрывает распределение задач, языков программирования, размеров проектов и длительности сессий. Отдельных данных о задержке ответа и фактической цене одной завершённой задачи тоже нет.

Вывод относится к реальным сценариям VS Code Copilot Chat: MAI-Code-1-Flash заняла сильную позицию среди лёгких моделей и приблизилась к более крупным решениям по сохранению кода при заметно меньшем расходе токенов.

Microsoft готовит более крупные MAI-модели для сложных задач

Публикация от 29 июля переносит обсуждение MAI-Code-1-Flash с уровня обещаний на уровень реальных достижений. Модель уже демонстрирует свою специализацию: она эффективна для быстрых итеративных задач, где разработчик многократно взаимодействует с агентом и контролирует расход лимита.

Microsoft планирует расширить семейство более крупными моделями MAI до конца 2026 года. Их заявленная цель связана со сложными задачами, глубоким рассуждением и конкуренцией с передовыми кодовыми моделями. Главная интрига теперь состоит в том, сохранит ли новое семейство эффективность Flash при росте качества и сложности выполняемой работы.

При использовании материалов сайта необходимо указывать ссылку на TGLand.ru. Если вы копируете фрагменты текста в интернете, прямая гиперссылка, доступная для индексации поисковыми системами, должна быть размещена в начале материала.

Вам также может понравиться