Qwen3-Coder-Next: мощная open-source модель от Alibaba с 10x ростом производительности для работы с репозиториями
Alibaba выпустила Qwen3-Coder-Next — специализированную open-source модель на 80 млрд параметров с ультраразреженной архитектурой MoE, которая обеспечивает в 10 раз более высокую пропускную способность по сравнению с плотными моделями аналогичного размера при работе с репозиториями.
Что такое Qwen3-Coder-Next?
Команда Qwen из Alibaba — один из мировых лидеров в open-source разработке ИИ — представила новую модель, которая создана специально для «vibe coders» и агентного программирования. Модель выпущена под лицензией Apache 2.0, что разрешает коммерческое использование как крупными компаниями, так и независимыми разработчиками. Веса модели доступны на Hugging Face в четырёх вариантах.
Ультраразреженная архитектура MoE: меньше — значит быстрее
Несмотря на то что модель содержит 80 миллиардов параметров в совокупности, во время обработки каждого токена активируется лишь 3 миллиарда параметров. Это достигается за счёт архитектуры Mixture-of-Experts (MoE) с 512 экспертами, из которых одновременно задействуются 10.
Такой подход позволяет модели:
- обеспечивать качество рассуждений, сопоставимое с массивными проприетарными системами;
- сохранять низкие затраты на развёртывание и высокую скорость вывода;
- работать локально на потребительском железе — Mac с 64 ГБ RAM или GPU RTX 5090 — со скоростью 20–40 токенов/с.
Решение проблемы длинного контекста
Ключевое техническое нововведение — гибридная архитектура Gated DeltaNet + Gated Attention, разработанная для преодоления квадратичного масштабирования стандартных трансформеров при росте контекстного окна.
Gated DeltaNet выступает линейной альтернативой стандартному softmax-вниманию, позволяя модели поддерживать состояние в окне из 262 144 токенов без экспоненциального роста задержки. В сочетании с ультраразреженным MoE это даёт теоретический прирост пропускной способности в 10 раз по сравнению с плотными моделями аналогичной ёмкости.
Для предотвращения галлюцинаций при работе с длинным контекстом во время обучения применялась стратегия Best-Fit Packing (BFP), исключающая ошибки усечения документов.
Агентное обучение: 800 000 верифицируемых задач
«Next» в названии модели отражает фундаментальный сдвиг в методологии обучения. В отличие от традиционных подходов, основанных на статических парах «код — текст», Qwen3-Coder-Next обучалась через масштабный агентный пайплайн:
- 800 000 верифицируемых задач — реальные сценарии исправления багов из GitHub pull request’ов с полностью исполняемыми окружениями;
- Система оркестрации MegaFlow на базе Alibaba Cloud Kubernetes — каждая задача проходит три стадии: rollout агента, оценка и постобработка;
- Обучение с подкреплением в реальном времени — если код не проходит юнит-тест или ломает контейнер, модель получает немедленную обратную связь и учится на ошибках.
Специализированные эксперты и поддержка 370 языков
Вместо единой «модели-дженералиста» команда разработала специализированных экспертов, знания которых затем дистиллировались в основную модель:
- Web Development Expert — для full-stack задач: построение UI, композиция компонентов; все образцы рендерились в Chromium через Playwright, а качество страниц оценивалось Vision-Language Model;
- User Experience Expert — оптимизирован для форматов вызова инструментов в различных CLI/IDE-окружениях (Cline, OpenCode).
Дополнительные характеристики продукта:
- Поддержка 370 языков программирования (в предыдущих версиях было 92);
- Новый формат XML-Style Tool Calling (
qwen3_coder), позволяющий передавать длинные фрагменты кода без накладных расходов JSON; - Среднее обучение на ~600 млрд токенов данных уровня репозитория — для лучшего понимания межфайловых зависимостей.
Бенчмарки: конкурирует с проприетарными гигантами
Результаты на ключевых отраслевых бенчмарках (скаффолд SWE-Agent) подтверждают конкурентоспособность модели:
- SWE-Bench Verified: 70.6% — опережает DeepSeek-V3.2 (70.2%), уступая лишь GLM-4.7 (74.2%);
- SecCodeBench (безопасность кода): 61.2% против 52.5% у Claude Opus 4.5;
- CWEval (многоязычная безопасность): func-sec@1 = 56.32% — превышает показатели DeepSeek-V3.2 и GLM-4.7.
Примечательно, что высокие показатели безопасности модель демонстрирует даже без явных подсказок, что свидетельствует о выработанной способности самостоятельно предвосхищать типичные уязвимости.
Итог
Qwen3-Coder-Next представляет собой наиболее серьёзный вызов доминированию закрытых моделей для программирования в 2026 году. Модель доказывает, что всего 3 миллиарда активных параметров достаточно для решения сложных задач реального инженерного проекта — при условии правильной архитектуры и подхода к обучению.
По словам команды Qwen: «Масштабирование агентного обучения, а не только размера модели — ключевой драйвер для продвижения возможностей реального агента по написанию кода». Эра «моделей-мамонтов» может уступить место ультрабыстрым экспертам, способным мыслить глубоко и работать стремительно.