Китай продолжает наступать, расщепляя американское преимущество в ИИ
Китай продолжает наступать, расщепляя американское преимущество в ИИ
Представлена новая модель Qwen-3.8 Max, которая по версии Alibaba сопоставима или даже превышает флагманы от OpenAI и Anthropic, но независимое тестирование менее оптимистичное.
Зафиксирован значительный прогресс в сравнении с предыдущей версией Qwen-3.7 Max, выходя на паритет с Opus-4.8 и GPT 5.5, как минимум, немного уступая Kimi K3.
Низкий показатель связан в Artificialanalysis (они удалили результаты из-за противоречивых тестов) с заниженной оценкой в SciCode и AA-Omniscience Accuracy, что, вероятно, связано с неоптимизированным запуском, тогда как более показательные тесты GDPval-AA v2 и AA-Briefcase демонстрируют серьезный прогресс Qwen и первую попытку за всю историю приближения к мировым флагманам.
Ранее серия моделей Qwen никогда не конкурировала в лидирующей группе.
По совокупности бенчмарков из различных источников, Qwen-3.8 Max не лидер и даже не впереди Kimi K3, но однозначно в группе лидеров, справедлива позиция на четвертом месте среди всех мировых LLMs.
Заявленная цена $2 за 1 млн входящих токенов и $6 за 1 млн исходящих токенов соответствует Grok-4.5 и GPT-5.6-terra, но примерно на четверть дешевле, чем Gemini-3.6-flash.
Однако, цена более, чем вдвое выше, чем у GLM-5.2, почти в 5 раз выше, чем у Minimax-m3, в 7 раз дороже, чем Mimo-v2.5-pro и Deepseek-v4-pro, в 8 раз дороже, чем GPT-5.6-luna и буквально на порядки дороже deepseek-v4-flash-0731.
Alibaba претендует на лидерство, но все же лидером не является, находится примерно в сопоставимой ценовой группе с Grok-4.5, GPT-5.6-terra и Gemini-3.6-flash.
Все решает совокупность факторов вне чистой производительности: потребление токенов на задачу, устойчивость контекстного окна, стабильность при долговременной работе, норма галлюцинаций, скорость выполнения, протоколы безопасности, точность следования инструкциям, восстановление после ошибок, надежность вызова инструментов и т.д.
Есть множество противоречивых результатов.
Примерно в 4 раза медленнее, чем Qwen3.7-Max по скорости генерации токенов в секунду и в 1.5 раза прожорливее по бюджету токенов потребность в 150 млн токенов для решения задачи vs 100 млн у Qwen3.7-Max.
Стоимость единицы интеллекта у Qwen3.8-Max примерно в двадцать раз выше, чем у открытой китайской альтернативы MIT-лицензии DeepSeek V4 Flash 0731.
Очень прожорливая по потреблению токенов, что делает Qwen-3.8 даже дороже GPT-5.6-sol, а впереди только флагманы Claude, которые исторически очень дорогие. По стоимости выполнения задачи Qwen-3.8 на порядок хуже топовых китайских моделей.
Из преимуществ:
Мультимодальность как новое качество: второе место на Arena.AI по мультимодальности единственный независимый результат, где модель действительно у фронтира.
Длительное автономное выполнение способность работать над проектами в течение многих дней, сохранять состояние, пересматривать план и использовать обратную связь. Alibaba заявляет о проектах продолжительностью более десяти дней и о работе в распространенных агентных средах. Пока не проверено.
Qwen-3.8 не перевернет рынок ИИ. Это вам не DeepSeek V4 Flash 0731, который на уровне GPT-5.6-terra и Gemini-3.6-flash, а стоит бесплатно, что заставило Альтмана в панике снижать цены на GPT-5.6-terra примерно в 5 раз!
Однако, Qwen-3.8 показывает, что технологический гэп между Китаем и США обнулен. Если бы они вышли на месяц раньше до GPT-5.6 Sol и Opus-5, были бы лидерами, но опоздали на месяц до эффекта технологического взрыва.
Прорыв мог быть, если бы Alibaba влепила цены втрое ниже заявленных в режиме агрессивного демпинга.
Пока фиксирует ползучие подступы к надлому технологического доминирования США.
Технологической революцией считаю DeepSeek V4 Flash 0731 и грядущее обновление DeepSeek V4 PRO все решает цена и доступность.
Китай подбирается с двух сторон сокращение технологического гэпа с флагманами Kimi K3 и Qwen-3.8 + агрессивный демпинг DeepSeek, Minimax, Mimo, Hy3, Step-3.7 и другие.