Data Secrets
Архитектура Qwen-4 уже почти здесь Model Scope запустили отсчет до выхода Qwen3.8-Flash-Next. Ее релизнут ровно через сутки, и это будет первая модель, построенная на архитектуре следующего поколения, на которой будет также основан Qwen-4. Пока деталей…
Вышел Qwen-3.8 Flash-Next

Это MoE 125B + 51B N-gram таблица (но активных всего 6B), которая бьет Opus 4.6 Max на 8 из 9 бенчмарков!

Также превосходит Qwen3.8-27B и DeepSeek-V4-Flash. При этом обучение стоило в 9 раз дешевле, чем Qwen3.7-Plus.

Немного про архитектуру. Ключевых новшества всего четыре:

1. Те самые N-gram эмбеддинги aka дешевая память. Это таблица, которая индексируется не по одному токену, а по коротким последовательностям. Модель как бы запоминает типичные локальные комбинации токенов напрямую в виде векторов, а не выучивает их заново на каждом шаге. Потом происходит обычный lookup вместо матричного умножения, поэтому такие эмбеддинги почти не добавляют вычислений на токен, зато сильно увеличивают общую емкость модели.

2. Gated DeltaNet + Qwen Sparse Attention для скорости на длинных контекстах. Модель не запоминает весь контекст целиком, а выбирает небольшие релевантные блоки и работает только с ними. Gated DeltaNet – линейный механизм внимания с гейтами, которые как раз управляют тем, что модель запоминает, а что забывает. Результат: на 1М контекста prefill стал в 7.6 раз быстрее, а decode – в 4.9 раз.

3. Gated Residual connections. Обычные residual-связи просто прокидывают информацию между слоями, а здесь добавлены гейты, которые решают, сколько именно информации пропустить дальше.

4. Оптимизатор Muon вместо классического Adam. Как раз один из факторов, давших 9-кратную экономию на обучении.

В итоге обучение дешевле, параметров больше, а вычислений на токен меньше. Очередное достижение китайского опенсорса.

Модель | Репорт | Блог
145🔥81👍20😍5🤩4😎3😁1👌1🤝1
This media is not supported in your browser
VIEW IN TELEGRAM
Вышло интервью с Тибо: главой Codex/ChatGPT в OpenAI

Это тот самый парень-инсайдер, который постоянно намекает в X на релизы и объявляет об обнулении лимитов. Возможно, по вырезке из интервью вы его не узнаете, но это он (жизнь в OpenAI немного помотала, и на свою аватарку из X инженер мало похож) 😐

Он выдал мощное заявление: через 2-3 месяца текущий Codex будет казаться примитивным. Агенты на базе следующего поколения моделей OpenAI (Astra) перестанут работать локально, им потребуется облако, в котором будет запускаться гораздо больше параллельных процессов, чем сможет потянуть обычный ноутбук.

При этом скорость агентов существенно вырастет, и то, что сейчас мы называем Ultra Fast (750 токенов в секунду и больше), станет настройкой по умолчанию.

Кроме того, нас ждет еще более плотное слияние Codex и ChatGPT. Будущие модели будут работать из коробки на одном и том же харнессе для кодинга, рисерча, дизайна, поиска и пр. Так что конечная цель – это единое высоко персонализированное приложение Personal AGI, интерфейс которого будет меняться в зависимости от того, чем конкретно вы занимаетесь.

Полное интервью идет 45 минут, посмотреть можно здесь: https://youtu.be/4qjEgPojjzM
Please open Telegram to view this post
VIEW IN TELEGRAM
3136❤‍🔥6123👍18🔥12🏆10😁8🤔6👏5🤗2
Data Secrets
На OpenRouter появилась таинственная модель Ox Alpha, которая превосходит Sol и Fable на кодинге https://openrouter.ai/stealth/ox-alpha Никто не знает, кто разработчик, моделька числится как stealth. Что известно: – Контекст 1М токенов. – Мультимодальная.…
Ox Alpha все-таки оказалась GLM-5.3-Flash: состоялся официальный релиз

Веса | Блог

Нативно мультимодальная, заточена под эффективный кодинг и длинные агентные задачи. Контекст 1М.

По метрикам уровень примерно Opus 4.8, кое-где даже лучше. Отличный скор на Automation Bench: 48.8 против 41 у того же Opus 4.8 и 37.2 у GPT-5.6 Terra. При этом это небольшая модель: 320B-A18B.

Модель доступна всем пользователям GLM Coding Plan + в API.

Цена сейчас: $0.075 за млн входных токенов, $0.25 за млн выходных (это со скидкой 50% на Open Router).

P.S. Интерсная деталь архитектуры – гибридное внимание. Z.ai объединили sparse + linear attention, чтобы удерживать точность на длинных контекстах без раздувания вычислительных затрат.
👏82👍3526🔥7🤨3😁2😎2❤‍🔥11