Alibaba Qwen3.8-Max демонструє 16-денний автономний кодинг-забіг

Alibaba Qwen3.8-Max: Новий рівень автономних моделей

Alibaba’s Qwen команда представила свій новий інноваційний продукт — Qwen3.8-Max, модель з 2.4 трильйонами параметрів та 95 мільярдами активних параметрів. Цей продукт створено для кодингу, офісної роботи, досліджень і довготривалих завдань з мінімальним наглядом. Модель доступна через QwenCloud, а відкриті ваги будуть доступні вже наступного тижня. Це вперше, коли Alibaba випустила Max-клас Qwen модель поза закритим API.

Інноваційний підхід до автономних завдань

Qwen3.8-Max базується на архітектурі, представленій в Qwen 3.5, яка акцентує на багатоденні автономні запуски замість одиночних відповідей. внутрішні тестові кейси, про які повідомила компанія, включають 16-денний проект з кодингу, відтворення наукових статей, участь в онлайн-змаганні, розробку чипів та річну симуляційну роботу в електронній комерції.

Документальні історії успіху

Одним з найбільш досконалих випадків став автономний проект “oh-my-cli”, який стартував з порожнього репозиторія GitHub. Модель інтегрувала такі компоненти, як машина станів задач, диспетчер і монітор у цикл роботи. За 16 днів, станом на 30 липня 2026 року, було здійснено 265 комітів, 127 пул-реквестів та 151 завдання, які публічно доступні на GitHub.

В іншому випадку Qwen3.8-Max відтворила та покращила опубліковану статтю ‘Unified Data Selection for LLM Reasoning’ без початкового коду за 125 годин. Модель відновила трубопровід статті та підтвердила її основні висновки, досягнувши поліпшення на +7.7 відсотка на AIME24 під benchmark.

Успіхи у конкурентному середовищі

Qwen3.8-Max також була протестована на зовнішньому змаганні, під час WWW2025 Multimodal Dialogue Intent Recognition Challenge на платформі Alibaba Cloud Tianchi. Вона перевершила 458 з 526 команд, покращивши точність з 0.60 до 0.853 у всіх поданих заявках.

Високопрофесійні можливості

Qwen3.8-Max оцінювалась у високовартісних професійних сценаріях, показуючи вражаючу продуктивність у порівнянні з традиційними робочими процесами у таких завданнях, як перевірка на відповідність нормативним вимогам та прототипування програм. Втім, ці заяви є наданими виробником і не ґрунтуються на споживацьких договорах або контрольованих дослідженнях.

У плані синтетичних вправ модель розробила GCD/RSA криптографічний акселератор і провела річну симуляційну роздрібну операцію, продемонструвавши обнадійливі результати у скороченні гейтів та фінансових підсумках.

Гнучкі можливості та доступність

Qwen3.8-Max пропонує параметр reasoning_effort для торгівлі глибиною та вартістю обчислень і сумісна з інтерфейсами OpenAI та Anthropic. Слідом за випуском відкритих вагів, третім сторонам буде надана можливість перевірити її можливості за межами пісочниць Alibaba.