Google посилив лінійку Flash, DeepSeek випустив офіційний V4 Flash з помітно кращими агентними здібностями, Meta зайшла в код-агенти з Muse, Alibaba оновила Qwen Max
Оновлення Gemini 3.6 Flash, 3.5 Flash Cyber
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Тепер є Gemini 3.5 Flash Cyber це спеціалізована модель для кібербезпеки (пошук, валідація та патчинг вразливостей) та вона доступна обмежено для урядів і довірених партнерів. Повна Gemini 3.5 Pro ще закрито тестується.
А ось Gemini 3.6 Flash тепер основна «робоча» модель. Краще генерує код (іноді краще ніж Gemini 3.1 Pro), працює з мультимодальними задачами, при цьому витрачає на 17% менше output-токенів (Artificial Analysis), а на деяких бенчмарках (наприклад DeepSWE) економія сягає 65%.
DeepSeek V4 Flash 0731
https://api-docs.deepseek.com/updates/#date-2026-07-31
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://arcprize.org/results/deepseek-v4-flash-0731
Офіційний реліз (замість preview) моделі з 284–304B параметрів (13B активних) та 1M контекстом вікном від DeepSeek - зараз у публічній бета на API. Ваги відкриті (MIT). Як й у Google з значно покращені агентні здібності й Flash тепер обходить власний V4-Pro Preview на більшості агентних бенчмарків, незважаючи на менший розмір та ціну.
Обіцяють й оновлення DeepSeek-V4-Pro. Модель адаптована під Codex і Responses API, але зараз можно налаштувати тільки deepseek-v4-flash - підтримка deepseek-v4-pro очікується теж найближчим часом. Компанія анонсувала підвищення цін на API (зараз вони надто низькі), але сама модель залишається відкритою для завантаження.
Обговорення
https://news.ycombinator.com/item?id=49214008
Люди обговорюють, наскільки модель дешева плюс достатньо розумна, що відкриває нові сценарії використання, які раніше були дорогими. Хтось уже ганяє на орендованих GPU (RTX 6000, MI300X тощо). Один користувач з 5–6 активними сесіями (фактично 12 потоків) витрачає менше $5 на день.
DeepSeek-центрованний ШІ агент
https://reasonix.io/
https://github.com/esengine/deepseek-reasonix
Локальний агент (один Go-бінарник без залежностей, MIT), оптимізований саме під DeepSeek з cache-first loop. Проект робить фокус на можливості доручити Reasonix довгі автономні завдання і при цьому не втратити контроль. Працювати з ним можна в терміналі, десктопному застосунку, браузері чи прямо в редакторі через ACP, і всі сесії спільні.
Reasonix спершу показує план роботи, а потім на кожному кроці питає дозволу на читання, запис чи виконання команд. Кожен «хід» зберігається як контрольна точка поза git, тож навіть після кількох годин роботи можна скасувати будь-яку зміну, не зачіпаючи історію комітів. Агента легко розширювати через MCP-сервери та власні навички.
Muse Spark 1.2 та Code
https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
https://dev.meta.ai/
Meta теж входить в простір код-асистентів. Muse Spark 1.2 це оновлення моделі, спеціально дотреноване на кодінг та використання власної харнес Muse Code. Покращення в генерації коду, debugging, розумінні великих репозиторіїв і long-horizon задачах.
Muse Code поки у beta, це термінальний код-агент (macOS/Linux, Windows поки немає). Підтримує асинхронні фонові агенти, режим планування (/plan, /grill, /goal), постійні субагенти та журнал подій (event-log) для безпечного перезапуску довгих сесій. Модель доступна в Muse Code і Meta Model API (є дешевший contributor-tier з використанням даних).
https://www.youtube.com/watch?v=c-V4MrY03Mc
Автор https://aicodingdaily.com/leaderboard протестував Muse Spark 1.2 на 15 кодинг-промптах (5 промптів × 3 проєкти: Flutter/Dart, синхронізація даних з мобільного додатку в API, імпорт CSV на PHP). Не через Muse Code, а через Open Code та OpenRouter, з вимірюванням швидкості та реальної вартості. Модель досить повільна й доволі дорога для таких результатів. Каже, що за такі гроші вже є значно кращі варіанти: DeepSeek V4 Flash навіть після підвищення цін, Grok 4.5 тощо.
Qwen 3.8 Max
https://artificialanalysis.ai/models/qwen3-8-max
Нова flagship-модель від Alibaba (2.4T MoE). На Artificial Analysis Intelligence Index спочатку показувала топ-результати (1–2 місце), після оновлення методики тестування опустилася на 9 місце, нижче за Kimi K3. Модель досить «балакуча» (багато токенів). Обіцяють відкриття вагів найближчим часом.
Тут є тонкощі, що таку велику відкриту модель звичайним людям не запустити локально, тому багато хто зараз на невеликих Qwen 3.5 та Qwen 3.6.
#newllmmodel #deepseek #metamuse #qwen