Китай продолжает наступать, расщепляя американское преимущество в ИИ

Китай продолжает наступать, расщепляя американское преимущество в ИИ

Китай продолжает наступать, расщепляя американское преимущество в ИИ

Представлена новая модель Qwen-3.8 Max, которая по версии Alibaba сопоставима или даже превышает флагманы от OpenAI и Anthropic, но независимое тестирование менее оптимистичное.

Зафиксирован значительный прогресс в сравнении с предыдущей версией – Qwen-3.7 Max, выходя на паритет с Opus-4.8 и GPT 5.5, как минимум, немного уступая Kimi K3.

Низкий показатель связан в Artificialanalysis (они удалили результаты из-за противоречивых тестов) с заниженной оценкой в SciCode и AA-Omniscience Accuracy, что, вероятно, связано с неоптимизированным запуском, тогда как более показательные тесты GDPval-AA v2 и AA-Briefcase демонстрируют серьезный прогресс Qwen и первую попытку за всю историю приближения к мировым флагманам.

Ранее серия моделей Qwen никогда не конкурировала в лидирующей группе.

По совокупности бенчмарков из различных источников, Qwen-3.8 Max – не лидер и даже не впереди Kimi K3, но однозначно в группе лидеров, справедлива позиция на четвертом месте среди всех мировых LLMs.

Заявленная цена$2 за 1 млн входящих токенов и $6 за 1 млн исходящих токенов – соответствует Grok-4.5 и GPT-5.6-terra, но примерно на четверть дешевле, чем Gemini-3.6-flash.

Однако, цена более, чем вдвое выше, чем у GLM-5.2, почти в 5 раз выше, чем у Minimax-m3, в 7 раз дороже, чем Mimo-v2.5-pro и Deepseek-v4-pro, в 8 раз дороже, чем GPT-5.6-luna и буквально на порядки дороже deepseek-v4-flash-0731.

Alibaba претендует на лидерство, но все же лидером не является, находится примерно в сопоставимой ценовой группе с Grok-4.5, GPT-5.6-terra и Gemini-3.6-flash.

Все решает совокупность факторов вне чистой производительности: потребление токенов на задачу, устойчивость контекстного окна, стабильность при долговременной работе, норма галлюцинаций, скорость выполнения, протоколы безопасности, точность следования инструкциям, восстановление после ошибок, надежность вызова инструментов и т.д.

Есть множество противоречивых результатов.

Примерно в 4 раза медленнее, чем Qwen3.7-Max по скорости генерации токенов в секунду и в 1.5 раза прожорливее по бюджету токенов – потребность в 150 млн токенов для решения задачи vs 100 млн у Qwen3.7-Max.

Стоимость единицы интеллекта у Qwen3.8-Max примерно в двадцать раз выше, чем у открытой китайской альтернативы MIT-лицензии – DeepSeek V4 Flash 0731.

Очень прожорливая по потреблению токенов, что делает Qwen-3.8 даже дороже GPT-5.6-sol, а впереди только флагманы Claude, которые исторически очень дорогие. По стоимости выполнения задачи Qwen-3.8 на порядок хуже топовых китайских моделей.

Из преимуществ:

Мультимодальность как новое качество: второе место на Arena.AI по мультимодальности – единственный независимый результат, где модель действительно у фронтира.

Длительное автономное выполнение – способность работать над проектами в течение многих дней, сохранять состояние, пересматривать план и использовать обратную связь. Alibaba заявляет о проектах продолжительностью более десяти дней и о работе в распространенных агентных средах. Пока не проверено.

Qwen-3.8 не перевернет рынок ИИ. Это вам не DeepSeek V4 Flash 0731, который на уровне GPT-5.6-terra и Gemini-3.6-flash, а стоит бесплатно, что заставило Альтмана в панике снижать цены на GPT-5.6-terra примерно в 5 раз!

Однако, Qwen-3.8 показывает, что технологический гэп между Китаем и США обнулен. Если бы они вышли на месяц раньше до GPT-5.6 Sol и Opus-5, были бы лидерами, но опоздали на месяц до эффекта «технологического взрыва».

Прорыв мог быть, если бы Alibaba влепила цены втрое ниже заявленных в режиме агрессивного демпинга.

Пока фиксирует ползучие подступы к надлому технологического доминирования США.

Технологической революцией считаю DeepSeek V4 Flash 0731 и грядущее обновление DeepSeek V4 PRO – все решает цена и доступность.

Китай подбирается с двух сторон – сокращение технологического гэпа с флагманами – Kimi K3 и Qwen-3.8 + агрессивный демпинг – DeepSeek, Minimax, Mimo, Hy3, Step-3.7 и другие.

Источник: Telegram-канал "Spydell_finance"

Топ

Лента новостей