CodeWithLLM-Updates
-
🤖 Інструменти ШІ для програмування: практичні приклади, покрокові інструкції та реальні застосування LLM. Навчіться ефективно працювати з сучасними асистентами програмування.

Теппер моделі так часто оновлюються: Opus 5.5, GPT-6 Sol і Luna, MiMo-V2.6, Grok 4.7 і Step 5 Preview.

Grok 4.7. Модель довше працює над складним завданнями, краще перевіряє себе і тримає довгий контекст, плюс її натренували розуміти власний Grok Bot harness.

GPT-6 Sol та Luna. Швидкий і дешевий рівень для заміни родини GPT-5.6. Sol і Luna разом закривають саме ціново-чутливий сегмент, тоді як Astra залишається топовою і найдорожчою моделлю OpenAI.

Claude Opus 5.5. Найкраща на сьодні модель. Наступник Opus 5 від Anthropic: за словами компанії, на більшості задач він виходить на рівень дорожчої Fable 5.1, але обходиться на 40% дешевше. Sonnet 5.5 і Haiku 5.5 обіцяють «найближчими тижнями».

Step 5 Preview
https://www.stepfun.com/step-5-preview
20 вересня китайська StepFun показала свій новий флагман для агентної роботи: MoE на 600B параметрів загалом і 27B активних. За їх тестами сильний software engineering, виший за рівень Kimi K3. Вже 15 жовтня обіцяють повністю відкриті ваги, зараз на Hugging Face лежить лише заглушка репозиторію.

Топ open-source модель від Xiaomi
https://mimo.xiaomi.com/mimo-v2-6/article
Xiaomi випустила моделі серії MiMo-V2.6: флагман MiMo-V2.6-Pro, економний MiMo-V2.6-Flash і MiMo-V2.6-Pro-UltraSpeed — той самий Pro, але з віддачею до 20x швидшою при тій самій якості. Xiaomi показала тренування наживо, стрімлячи його під час релізу. Разом із моделями відкрито технотрейт, середовища тренування і весь RL-код.

Обидві основні моделі нативно omnimodal (текст, відео, аудіо, зображення в одному контексті) з вікном 1М токенів. Pro на Artificial Analysis Intelligence Index обійшовши Kimi K3 і Qwen3.8 Max, хоча до закритих моделей й не дотягує.

MiMo Code та MiMo Desktop
https://github.com/XiaomiMiMo/MiMo-Code
https://mimo.mi.com/docs/en-US/updates/feature/desktop
Термінальний open-source кодінг-асистент MiMo Code це форк OpenCode під MIT з оркестрацією субагентів і вбудованим безкоштовним каналом MiMo Auto. Тепер працює на моделях V2.6. MiMo Desktop разом з релізом V2.6 вийшов з early access у перший офіційний реліз. Це десктопний клієнт для агентів під задачу, керування браузером, інтерактивні прев'ю результатів прямо в сесії.

omp (oh-my-pi) — це форк Pi від Маріо Зехнера, переписаний під реальний флоу розробки: сесії, підагенти, слеш-команди, розширення. TypeScript + Rust на macOS/Linux/Windows без WSL.

https://omp.sh/docs/agents-and-roles
Тут є три шари:

  • Модель — конкретний провайдер й модель (Claude, GPT…).
  • Роль — іменований слот: default для звичайних запитів, smol для дешевої дрібнії роботи, slow для глибокого мислення й рев'ю, plan, vision, commit, task, далі розберем.
    • Агенти та підагенти — хто саме виконує (reviewer, scout, designer). Агент дивиться на роль, роль — на модель. З коробки scout (швидкий read-only огляд репо), designer, reviewer, security-reviewer, librarian (перевірка зовнішніх API), task, sonic (механічні правки).

Коли міняєш модель у ролі slow, усі майбутні агенти рев'юери автоматично переходять на неї. Агентів харнес обирає сама в залежності від промту.

https://omp.sh/docs/advisor
На спеціальний агент Advisor можна назначити окрему модель, яка читає кожен крок основного агента (промпти, відповіді, міркування, виклики інструментів) й додає нотатки прямо в сесію, а іноді може відразу зупинити весь потік, якщо він точно іде не куди потрібно!

Вона працює на своєму контексті й зовсім іншій моделі (краще щоб розмір контексного вікна співпадав): основний потік може бігти на Gemini 3.8 Flash, а advisor'ом призначити, скажімо, Meta Spark 1.3 — різні моделі дивляться на ту саму роботу з різних кутів. Advisor не затверджує дії: основний агент зобов'язаний зважувати кожну нотатку проти запиту, а не сліпо коритися.

Вмикається двома рядками в конфіг, або через /advisor. Три рівні порад: nit — непереривна ремарка («тут можна спростити»); concern — ризик чи не той напрямок, може перервати хід; blocker — продовжувати явно марно, вийде зламаний результат. Підагенти за замовчуванням без advisor.

Ідею advisor уже винесли назад у чистий Pi: порт pasky/pi-omplike-advisor https://github.com/pasky/pi-omplike-advisor, постійна read-only модель, що на кожен крок рев'юїть роботу головного агента.

Звичайний git status на старті агента виконує команду із самого репозиторію

Вразливість GitSpawn від Manifold
https://www.manifold.security/blog/ai-coding-agents-git-hijack
Багато CLI-агентів на старті збирають контекст проєкту через git status / git diff й що дивно на деяких це відбувається до workspace-trust prompt: на Qwen Code навіть до логіну, на Grok Build достатньо першої клавіші. Так можна виконати core.fsmonitor = <команда> поза пісочницею агента, без жодного approval-діалогу, з правами користувача: SSH-ключі, токени з shell config, хмарні credentials, всі репозиторії на диску.

Треба дивитись .git/config перед відкриттям агента отриманого як файли репо, також можна глобально заблокувати git config --global core.fsmonitor false.

Тестували 7 агентів: Claude Code, Codex, Cursor, Goose, Hermes, Qwen Code, Grok Build. Вже патчені: Claude Code 2.1.196 (основний шлях), Codex 0.131.0 (CVE-2026-19592), Cursor, Goose 1.44.0 (CVE-2026-72718, CVSS 7.0). В процесі Qwen Code (Alibaba SRC прийняв звіт — але не виправив), Grok Build, Hermes.

Глибша проблема в тому, що пісочниця агента тут ілюзія: будь-який subprocess успадковує OS-привілеї користувача і повну trust-модель git.

OpenHands за півроку перетворився з агента на платформу над агентами

OpenHands від агента до координатора
https://www.openhands.dev/blog/introducing-agent-canvas
https://docs.openhands.dev/openhands/usage/agent-canvas/acp-agents
Раніше OpenHands сам був агентом, тепер через Agent Client Protocol (ACP) він запускає і обслуговує харнеси як то Claude Code, Codex і сам OpenHands на декстопі. Завели в архітектуру ще навесні, а за літо стало центральним сценарієм. Agent Canvas тепер фактично головний інтерфейс з якого можна ганяти кілька агентів паралельно, дивитись файли, команди, розмови, автоматизації і чіпляти віддалені бекенди. Додали ясний context-window usage meter, drawer з інфо про витрату контексту і ручна compaction.

Зʼявився обʼєкт Agent Profile — збережена конфігурація як саме стартувати агента. Там лежить тип агента, модель, credentials та scoped secrets, MCP-сервери, skills і інше. Автоматизація з простої фічі перетворились на оркестратор з вибором Agent Profile, експорт/імпорт як JSON, настроювані таймаути, запуск conversation через plugin, cron, live phase виконання, розуміння результату task, теги, права view/manage, автовідключення після серії помилок. Рухаються в сторону, де помилки агента ловляться автоматично.

Памʼять у Grok Build, Zen проти чужих харнесів, зовсім інший Jev і Geiger.

Geiger для пошуку AI-агентів
https://atomburst.io/geiger
Якщо у вас як і у мене постійно тестуются агенти, то ось одна команда npx geiger-scan показує що реально стоїть і що воно може чіпати. Нуль залежностей, без акаунта і телеметрії, потрібен тільки Node 18+. Тільки читає конфіги і папки, нічого знайденого не запускає. Пише лише файл звіту який сам попросиш через --json / --html. Знаходить багато відомих агентів і IDE. Окремо MCP-сервери глобальні і проєктні включно з remote, розширення редакторів і браузерів, AI-браузери.

Памʼять у Grok Build
https://x.ai/news/grok-build-memory
Grok Build тепер памʼятає проєкт між сесіями: конвенції, рішення, факти. Після кожного кроку у фоні переглядає його і дописує тільки довговічне, робота при цьому не зупиняється. Це markdown-файли, один файл на тему. Є рівень проєкту і окремо глобальний для звичок юзера.

Команда /memory відкриває простий перегляд файлів по групах з пошуком і превʼю, /dream розкладає свіже по топіках і сам іноді прибирає у фоні. Фонове прибирання Dream біжить в один потік через dream_lock, старе складає в архів.

OpenCode Zen ріже чужі харнеси
https://github.com/can1357/oh-my-pi/issues/12306
Схоже на історію з Antigravity минулого тижня (до речі OMP пофіксили окремим плагіном), тут гейтвей відсікає чужих. Без хедерів x-opencode-client, x-opencode-session, x-opencode-project, x-opencode-request та тулз-профілів Zen особливо для для free-моделей відповідає 429 FreeUsageLimitError або просто висить. Pi-екстеншени зараз імітують ці хедери з випадковими id щоб виглядати як CLI. В тредах це називають підробкою ідентичності з ризиком повного блокування аккаунту.

Зовсім інша модель — Jev / System One від TypeSafe
https://console.typesafe.ai
https://typesafe.ai/blog/introducing-system-one-models-and-jev
Перша модель Jev названа на честь Джевонса. Це не чат, а System One за Канеманом: на вході стан, на виході готові рішення для коду.
Шлеш state текстом, JSON чи масивом плюс список типізованих питань Choice, Score, Noul — і за один паралельний прохід отримуєш всі відповіді з каліброваними ймовірностями.

Архітектура нова, семплер паралельний, тренування RLCD замість RLHF / RLVR. Схема задана наперед, тому вийти за типи чи згалюцинувати текстом просто нема куди. Доступ поки по waitlist: ендпоінт POST api.typesafe.ai/v1/systemone, jev-latest зараз це jev-1.13.0, поруч jev-preview, SDK для Python і JS, скіл для Claude Code, ключ у console.typesafe.ai/settings/keys.

Cline теж будує нативний Desktop

Найбільший апгрейд Cline
https://cline.bot/blog/how-we-migrated-11-million-users-to-clines-biggest-harness-upgrade
Cline як VSCode екстеншн народився в 2024, це ще при Claude 3.5 Sonnet. Кожна нова модель та провайдер адаптувалися вручну. Новий Cline SDK винесли в окремий модульний рантайм: промпти переписали, луп спростили, контекст і тул-дефінішени підтягнули під нативний tool calling 2026-х моделей замість XML-тегів з тексту. Зараз повністю перевели всіх 11 млн юзерів на нього.

Cline for Desktop (Beta)
https://cline.bot/desktop
https://github.com/cline/cline/releases/
Почали тестувати окремий нативний застосунок на macOS (Universal) і Windows як зараз модно без редактора коду. Всередині той самий open-source Cline harness, що тепер в IDE і CLI. Зібраний на Tauri 2 + Bun-sidecar + Next.js: Tauri тримає тільки вікно й апдейти, Bun-сайдкар крутить Cline Hub і спілкується з UI по websocket, фронт це Next.js.

Працює по BYOK — Anthropic, OpenAI, Gemini, open-weights чи локальний ендпоінт, моделі можна перемикати прямо посеред проєкту. Інтегрований з їх підпискою Cline Pass за $9.99/місяць на open-weights моделі як то GLM 5.3/5.2, Kimi K3/K2.7 Code/K2.6, DeepSeek V4 Pro/Flash, MiniMax M3, MiMo V2.5/Pro, Qwen 3.7-Max/Plus і 3.8-Max.

Вже є queued messages, докидати правки поки агент працює, fork & edit — правиш старе повідомлення і сесія форкається з ревертом воркспейсу до чекпоінта, session history в одному місці — десктоп, CLI, екстеншн і scheduled runs, з фільтром звідки сесія.

В мене на Windows поки що видає купу помилок при налаштуванні моделей й не працює.

Схоже, Google вслід за Anthropic намагається обмежити свої моделі за підписним планом лише власним харнесом, ускладнюючи використання цих credentials у сторонніх AI-агентах.

https://news.ycombinator.com/item?id=49548452
Тиждень тому в обговоренні є повідомлення про блокування Google-акаунтів за використання Antigravity через сторонні інструменти. Google прямо називає використання credentials у third-party tool порушенням ToS що може призвести за собою блокування аккаунту. Є окремий коментар користувача, якому заблокували доступ після використання Pi agent + Antigravity.

https://github.com/can1357/oh-my-pi/issues/11689
Вчора у людей в oh-my-pi (OMP) Gemini через Antigravity раптом почав стабільно віддавати 429 RESOURCE_EXHAUSTED і просити почекати 30 хвилин — причому це триває годинами. Це не витрата квоти, а mismatch entitlement — Google ріже agent-бакет для стороннього харнеса під виглядом RESOURCE_EXHAUSTED.

OMP — форк Pi, а OpenClaw теж використовує Pi як основу агентного runtime. Тобто проблема потенційно стосується вже цілої гілки сторонніх агентів.

SOTA-парад: GPT-6 Astra, Claude Fable 5.1, Muse Spark 1.3, Gemini 3.8 Flash і пост-трейн Qwen 3.8 Max 0902.

Muse Spark 1.3
https://research.meta.ai/blog/introducing-muse-spark-1-3
На їх тестах дуже красиво прям SOTA, а в результатах не сходиться: skill-інструкції губить, замість точкового едіта може переписувати файл цілком, сайти виглядають криво. Все як моделі рік тому. Окремо продовжується дешевий contributor-прайс як демпінг. Meta пише, що попереду open-weights release для Muse Spark.

Gemini 3.8 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Pro немає вже давно, це третій Flash апдейт за шість тижнів, заточений під довгі кодінг сессії агентів (що нам приємно), відразу в API, AI Studio, Antigravity. Дешевий прайс лишили до кінця року. Вміє працювати дрібними ітераціями — «працює старанніше», але саме тому на складному жере більше токенів, сам Google так і пише. Cyber-версія тільки для довірених захисників.

Claude Fable 5.1
https://www.anthropic.com/claude/fable
Покращили до Fable 5.1 (загальнодоступна) + Mythos 5.1 (обмежена). Дорогі, але топ. Кажуть, навчили не звітувати про фейковий успіх і не зрізати кути типу відключити падаючий тест. Довгу автономку менше треба пасти, ревʼю швидше. Писати стала людяніше, але непомітно маркує текст (вотермаркінг), на HN окремо хвалять що пішла шаблонність.

GPT-6 Astra — доводить довге до кінця, але жере ліміт
https://openai.com/index/gpt-6-astra/
На 7 вересня GPT-6 Astra у відкритому доступі лише кілька днів. OpenAI позиціонує її як модель не стільки для "генерувати робочій код", скільки для самостійного проходження всього циклу software engineering. Дуже круті демки ігор, також можливість "взяти під контроль" Blender та Unity чи Godot через керування комп'ютером. Це все довго та дорого, але до результату доводить.

У документації прямо підкреслюється: складне міркування, coding, computer use, research і довгі багатокрокові задачі. Astra може працювати з репозиторієм, запускати програми, бачити результати, виправляти помилки, продовжувати роботу після зміни вимог і, у Codex, навіть ставити запитання асинхронно, не зупиняючи незалежні частини роботи.

Astra має 1 млн токенів, але фактичний доступний context у конкретному Codex environment може бути набагато меншим. Також OpenAI ввела новий механізм збереження контексту: замість звичного постійного compaction старих сесій модель може вести notes між вікнами, причому попередні контекстні вікна залишаються searchable.

У даних Terminal-Bench 4.0 розриву між Astra і Fable 5.1 майже немає. Але саме Astra відчувається більш самостійною й тією що розуміє репозиторій (хоча не завжди). Вже помітне надмірне споживання usage/token budget. На Reddit є кілька повідомлень, де користувачі кажуть, що Astra могла витратити значну частину п'ятигодинного ліміту буквально за одну сесію. У мене в Codex на Plus підписки 5-годинний ліміт зжерла виконуючи просте завдання менше ніж за 15 хвилин, є підозра що вікно це ще прижали.

У звичній на сьогодні моделі роботи програміст є оператором AI: промт → отримав код (діфи) → перевірив → накидав правок. У Astra дедалі реалістичнішим стає інший режим коли програміст задає намір, обмеження та критерії завершеності, після чого модель сама розкручує процес. Головний апгрейд Astra — не в тому, що вона генерує не поламаний код, а в тому, що вона дедалі частіше (але не завжди) здатна довести все завдання до кінця.

Офіційне середовище для агентів від DeepSeek на мікроядрі Cordis.

DeepSeek Harness (dsh)
https://github.com/deepseek-ai/deepseek-harness
https://www.deepseek.com/harness/en/
13 серпня разом з релізом DeepSeek-V4-Pro-0813 вийшов офіційний відкритий харнес від DeepSeek — dsh на мікроядрі Cordis. Його спочатку створив розробник Shigma як основу для фреймворку чат-ботів Koishi. Згодом виділили в окремий проект (Cordiverse), а дослідники з Пекінського університету та DeepSeek формалізували його математичну модель у статті про «просторово-часову компонованість». Описали можливість динамічно підключати, оновлювати й вивантажувати плагіни прямо під час роботи програми без її перезапуску.

Архітектура побудована за принципом «усе є плагіном»: цикл роботи агента, інструменти, ізольована пісочниця та інтерфейс користувача реалізовані як окремі модулі зі зворотними ефектами (чистим скасуванням змін) і спільним контекстом. Ліцензія MIT, проект поки на стадії раннього доступу для розробників із можливими змінами в API. У репозиторії є навчальні посібники для створення власних розширень, а спільнота вже публікує додаткові плагіни з тегом dsh-plugin.

https://www.youtube.com/watch?v=RWp5cejTApU

У практичному огляді автор демонструє реальний робочий процес у веб-інтерфейсі dsh. Головні корисні можливості з відео:

  • Вбудований маркетплейс (Harness Market) — встановлення розширень, додаткових інструментів та сторонніх провайдерів моделей прямо з інтерфейсу.
  • Режими роботи (Code, Minimal, Creator) — зокрема режим Creator для налаштування власних пресетів агентів та інспекції стану системи.
  • Керування робочими просторами та живий контроль — організація проєктів за папками, а також можливість ставити виконання на паузу та коригувати цілі на льоту без перезапуску всієї сесії.

Обговорення
https://news.ycombinator.com/item?id=49285244
На Hacker News проект обговорюють насамперед як приклад інженерії агентних систем. Головний висновок розробників — продумане середовище (цикли зворотного зв'язку, контроль контексту та виклики інструментів) зараз дає не менший ефект, ніж оновлення самої моделі.

Також порівнюють з Reasonix (компактний агент на Go, оптимізований під DeepSeek, MIT): Reasonix націлений на максимальну економію завдяки стабільному префіксному кешуванню для довгих сесій (часто менше $1–2 на задачу), тоді як dsh є більш універсальним, розширюваним та офіційним каркасом.

Змини в доступних моделях. OpenAI відключає Cursor після його покупки SpaceX.

OpenAI розриває контракт з Cursor!
https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/
https://cursor.com/blog/joining-spacex
14 серпня Cursor (Anysphere) офіційно став частиною SpaceX — all-stock угода на ≈$60 млрд з доступом до GPU-інфраструктури Colossus для тренування. 28 серпня OpenAI повідомила SpaceX, що згортає контракт на постачання своїх моделей у Cursor з датою відключення 12 листопада 2026 — це максимальний notice за їхнім кастомним договором.

Рішення пояснюють недовірою: OpenAI пише, що не може бути впевнена, що SpaceX дотримуватиметься ToS, згадуючи порушення контракту Twitter (тепер частина SpaceX) після купівлі Маском та визнання під присягою цьогоріч, що xAI дистилювала дані OpenAI для тренування. Окремо згадують новий рівень відповідальності для наступної моделі Astra — тому майбутні моделі Cursor не отримає як частину підписки, хоча через власний API-ключ залишається.

Обговорення
https://news.ycombinator.com/item?id=49486172
Колись Cursor цінували саме як обгортку навколо топ моделей OpenAI/Claude, а тепер вона стає майданчиком для розгортання Grok від Маска. Вони заплатили не за IDE, а за мільярди промптів і код-контекстів для тренування. Люди гадають чи забанить Anthropic тепер Cursor. Засновник Cursor у твіті пише, що мовляв моделі OpenAI це лише ≈5% трафіку, але в коментах уточнюють що по revenue це значно більше. Частина розробників шукають куди мігрувати — JetBrains, Zed, OpenCode, Codex, бо втрачати можливість перемикати Sol/Terra для планування + Composer/Claude для реалізації не хочуть.

В OpenCode Zen зник безкоштовний DeepSeek Flash
Користувачі помітили, що в безкоштовному шлюзі OpenCode Zen зник deepseek-v4-flash-free, а якщо була підключена через API то почала видавати помилку "401 No payment method. Add a payment method here" — модель, через яку багато хто (та й я) робив 100% безкоштовний якісний код останні тижні. Офіційного анонсу немає, в issues та на Reddit просто "unavailable". На самому DeepSeek API з 16 серпня там новий peak/off-peak прайсинг (пік 01:00–04:00 та 06:00–10:00 UTC у 2× дорожче, загалом +3.5–4.7×).

GLM-5.3, GLM-5.3 Flash як ox-alpha та Qwen 3.8 Flash
https://z.ai/blog/glm-5.3
https://z.ai/blog/glm-5.3-flash
https://qwen.ai/blog?id=qwen3.8-flash-next
Z.ai 14 серпня випустила GLM-5.3 на тій же 743B базі що GLM-5.2, все за рахунок post-training. А 26 серпня вийшов GLM-5.3 Flash вже на новій базі — MoE 320B total / 18B активних, перший відкритий frontier з гібридним sparse+linear attention (KV-кеш у ≈4.4× менший), нативна мультимодальність (текст+картинка+відео), 1M контекст, MIT. До анонсу його тиждень ганяли анонімно на OpenRouter та в OpenCode Zen як stealth/ox-alpha — став найпопулярнішою моделлю тижня, на рівні Claude Opus 4.8 за ≈1/10 ціни.

Того ж 26 серпня Alibaba викотив Qwen3.8-Flash-Next (в API — Qwen3.8-Flash) — прев'ю архітектури для Qwen4: MoE 125B + 51B N-gram memory + 4B MTP, лише 6B активних, Qwen Sparse Attention на мікро-блоках, gated residual, 262K нативно (тягнеться до 1M), мультимодальність, ліцензія Qwen 1.0.

Voyage Code 4 — ембедінги заточені під агентів
https://blog.voyageai.com/2026/08/13/voyage-code-4/
З грудня 2024 voyage-code-3 був однією з найпопулярніших моделей Voyage взагалі — хітом саме серед код-ембедінгів для RAG і семантичного пошуку, його масово підключили код-асистенти (Cursor, Continue, Cody та інші) як базу для пошуку релевантних файлів і сніпетів. Але зараз більшість запитів роблять уже не люди, а агенти.

Нове покоління лінійки Voyage Code, наступник code-3, перезібраний саме під агентів. На практиці це означає що модель помітно частіше знаходить потрібний файл з першої спроби: на 19 нових агентних бенчмарках (held-out репо, NDCG@10 — чим вище, тим краще знаходить релевантне) вона приблизно на третину краще за найближчих конкурентів Cohere та Gemini і майже в півтора раза краще за OpenAI. При цьому вона гнучка і дешевша.

Vercel та Slack теж хочуть бути на ринку кодінг інструментів.

fx — крихітний нативний код-агент
https://fx.sh/
https://github.com/vercel-labs/fx
fx яу відповідь на роздуття агентних TUI від Vercel Labs це поки що експерементальний харнес у CLI на Zig, бінарник 6–8 МБ, старт за мікросекунди, мінімальний системний промпт, UI ближче до Unix-шелла, ніж до «IDE в терміналі». Apache-2.0 ліцензія. Є Wasm-збірка (демо прямо в браузері), skills, MCP, субагенти, ACP для редакторів.

Моделі через Vercel AI Gateway чи підписку Codex (fx login codex) або Grok (fx login grok); за замовчуванням зараз у демо стоїть glm-5.2. Поки v0.0.5, «use at your own risk».

Slack Code: агентний кодинг для команд
https://www.salesforce.com/introducing-slack-code/
Salesforce запускає Slack Code — окремі code канали всередині Slack, де можна тегнути код-агента (Claude, Devin, GitHub Copilot, ChatGPT, агенти Vercel) і разом дивитися дифи, прев’ю та апрувити роботу, не виходячи з чату. Є вкладка Agents і «Add to Slack» для агентів з Lovable, n8n, LangChain тощо. На старті працює з агентами партнерів і доступний на будь-якому плані Slack — але потрібен окремий доступ до кожного агента.

Ідея проста: зараз розмова людини з агентом відбувається в приватній вкладці, команда цього не бачить, контекст губиться. У Slack Code канал створюється під одну задачу, коли непотрібно - архівується, історія лишається як лог. Показують сценарій, де PM сам тегає агента на баг, інженер лише перевіряє диф і дає добро на PR.

Proliferate: open-source IDE для кількох агентів
https://github.com/proliferate-ai/proliferate/releases
https://proliferate.com/
Proliferate це спроба зібрати команду агентів з ізоляцією гілок і спільним рев’ю. Проект open-source (AGPL-3.0), де в одному воркспейсі паралельно крутяться нативні харнеси: Claude Code, Codex, OpenCode, Cursor, Grok. Кожна задача — окремий git worktree (або хмарний sandbox, який живе, коли ноутбук закритий), є субагенти, спільні MCP/skills і beta workflows (нічні рев’ю, triage з CI, бампи залежностей).

jcode під спільну работу агентів
https://jcode.sh/
https://github.com/1jehuang/jcode
https://www.ycombinator.com/companies/jcode
jcode — open-source (MIT) термінальний агент, написаний на Rust, від Jeremy Huang, Y Combinator. Місія проекту розпаралелити десятки задач одночасно. Ключова фішка це наднизьке споживання пам’яті, за вимірами проекту 10.4 MB на додаткову сесію проти 212.7 MB у Claude Code, тобто 10 сесій jcode менше половини одного Claude Code.

TUI при цьому повноцінний з підтримкою зображень, LaTeX/math, діаграми/Mermaid, є live-прогрес фонових-задач, swarm-режим з нотифікаціями про конфлікти файлів і меседжингом між агентами.

Orca від Stably
https://onorca.dev/
https://github.com/stablyai/orca
Orca це окремий open-source ADE (Agent Development Environment, MIT). Це десктоп-IDE для паралельних агентів: кожна задача — окремий git worktree + свій термінал (Ghostty-inspired) + браузер, можна ганяти Claude Code, Codex, OpenCode, Cursor side-by-side, є мобільні компаньйони та Orca CLI.

https://www.youtube.com/watch?v=vZUUHMCBoQg

Практична цінність це Workspace Board для роздачі задач різним агентам та єдиний Diff Review для рев’ю/мерджу без стрибків між гілками, та вбудований Chromium з Design Mode (інспекція DOM → копія розмітки агенту для точкового фіксу верстки), спліти вкладок, інтегрований редактор, автоматизація git-workflow (створення worktree через Cmd+N + setup-скрипт pnpm install, стейджинг/коміти/PR).

Тиждень міні-апдейтів: Grok 4.6, Gemini 3.7 Flash, DeepSeek V4-Pro 0813, GLM-5.3, Qwen 3.8 27B, MAI-Code 1.1 Flash і Muse Glimmer — всі підтягнули генерацію коду без зміни архітектури.

Grok 4.6
https://x.ai/news/grok-4-6
xAI випустила 12 серпня чисто post-training оновлення на тому ж ≈1.5T базі, що й Grok 4.5. З точки зору генерації коду це 1 публічний результат на FrontierCode v1.1 Extended (61.3%), APEX-SWE 56.4%, CursorBench v3.2 підріс з 66.7% до 69.9%. Головне покращення — модель більше самостійно тестує й перевіряє свій код у довгих агентних сесіях, тож витрачає значно менше марних кроків (≈53 ходи проти ≈103 у Claude Opus 5).

Слабке місце як і раніше — робота в терміналі (Terminal-Bench 3.0 лише 26%). Елон пише що Grok 4.7 вже за декілька тижнів. Оновлення потрохи рухають модель все вище у рейтингу artificialanalysis й наближують до найкращіх.

DeepSeek V4-Pro 0813
https://api-docs.deepseek.com/updates/
13 серпня Pro-рівень нарешті отримав той самий агентний post-training, що вже був у V4-Flash 0731 — і це вже повноцінний production-реліз, а не preview. Операційно додали підтримку OpenAI Responses API, нарешті one-click налаштування Codex і керування рівнем reasoning (low/high/max). Ваги для 0813 не публікували.

Gemini 3.7 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Google 13 серпня, за три тижні після 3.6 Flash. Найбільший стрибок усієї Flash-лінійки саме в кодінгу: DeepSWE v1.1 з 49.0% до 65.3% (якщо вірити тестам), FrontierCode 1.1 Main з 34.4% до 43.6% а в таблиці Google це краще за Claude Sonnet 5 і GPT-5.6 Terra - оце так. Додатково майже вдвічі дешевша на старті ($0.75/$3.75 за M токенів до кінця 2026), контекст 1M.

GLM-5.3
https://z.ai/blog/glm-5.3
Z.ai 14 серпня, та сама 743B база, що й GLM-5.2, всі здобутки — з post-training (IndexShare + SAO). Код: +50% на внутрішньому Z.ai Code Bench, Terminal-Bench 3.0 28.3% (найкращий показник серед open-weights, для порівняння GLM-5.2 мав 4.6%), DeepSWE 1.1 66.9%. Говорять, що кіберспроможність (CyberGym 84.5%, ExploitBench з 24.4% до 54.4%) настільки зросла, що випуск вагів затримали на два тижні для safety-перевірки. Поки лише GLM Coding Plan та ZCode.


Qwen 3.8 27B
https://huggingface.co/Qwen/Qwen3.8-27B
Alibaba 14 серпня, щільна (dense) мультимодальна 27B-модель під Apache 2.0 — дистиляція флагманського Qwen3.8 Max для локального запуску. Все тести показують помітний ріст над Qwen3.6-27B, чого ми й чекали. Рідний контекст 262K (розширюється до 1M через YaRN), тягнеться на звичайних топових GPU та Ryzen AI Max.

MAI-Code 1.1 Flash
https://microsoft.ai/models/mai-code-1-flash/
https://github.blog/changelog/2026-08-11-mai-code-1-1-flash-available-in-github-copilot/
Microsoft 11 серпня оновила свою невелику код-модель (MoE з ≈5B активних) і запустила в GitHub Copilot. Оновлення зроблене під реальні скарги розробників, тому дотягнули +22% на Terminal-Bench 2.1 і +15% на .NET, плюс native vision (розуміє скріншоти й діаграми). Для рутинних легких задач стало важливішим інше: на 25% ефективніша за токенами і вчетверо дешевша (на 73% нижчий список, ніж у 1.0) — тренована з нуля на чистому enterprise-датасеті без дистиляції.

Muse Glimmer
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
Meta 10 серпня вперше за 16 місяців (після Llama 4) випустила знову open-weights модель — 30B під Apache 2.0, дистиляція закритого Muse Spark для локального запуску на одній споживчій GPU (4-bit квантування ≈ 17GB VRAM). Для коду лідирує в своєму класі за агентними задачами, але програє Qwen3.6-27B (а там вже 3.8 вийшла). Цікаво, що разом з нею Цукерберг пообіцяв колись відкрити ваги і більш потужної Muse Spark 1.2.

Google посилив лінійку Flash, DeepSeek випустив офіційний V4 Flash з помітно кращими агентними здібностями, Meta зайшла в код-агенти з Muse, Alibaba оновила Qwen Max

Оновлення Gemini 3.6 Flash, 3.5 Flash Cyber
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Тепер є Gemini 3.5 Flash Cyber це спеціалізована модель для кібербезпеки (пошук, валідація та патчинг вразливостей) та вона доступна обмежено для урядів і довірених партнерів. Повна Gemini 3.5 Pro ще закрито тестується.

А ось Gemini 3.6 Flash тепер основна «робоча» модель. Краще генерує код (іноді краще ніж Gemini 3.1 Pro), працює з мультимодальними задачами, при цьому витрачає на 17% менше output-токенів (Artificial Analysis), а на деяких бенчмарках (наприклад DeepSWE) економія сягає 65%.

DeepSeek V4 Flash 0731
https://api-docs.deepseek.com/updates/#date-2026-07-31
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://arcprize.org/results/deepseek-v4-flash-0731
Офіційний реліз (замість preview) моделі з 284–304B параметрів (13B активних) та 1M контекстом вікном від DeepSeek - зараз у публічній бета на API. Ваги відкриті (MIT). Як й у Google з значно покращені агентні здібності й Flash тепер обходить власний V4-Pro Preview на більшості агентних бенчмарків, незважаючи на менший розмір та ціну.

Обіцяють й оновлення DeepSeek-V4-Pro. Модель адаптована під Codex і Responses API, але зараз можно налаштувати тільки deepseek-v4-flash - підтримка deepseek-v4-pro очікується теж найближчим часом. Компанія анонсувала підвищення цін на API (зараз вони надто низькі), але сама модель залишається відкритою для завантаження.

Обговорення
https://news.ycombinator.com/item?id=49214008
Люди обговорюють, наскільки модель дешева плюс достатньо розумна, що відкриває нові сценарії використання, які раніше були дорогими. Хтось уже ганяє на орендованих GPU (RTX 6000, MI300X тощо). Один користувач з 5–6 активними сесіями (фактично 12 потоків) витрачає менше $5 на день.

DeepSeek-центрованний ШІ агент
https://reasonix.io/
https://github.com/esengine/deepseek-reasonix
Локальний агент (один Go-бінарник без залежностей, MIT), оптимізований саме під DeepSeek з cache-first loop. Проект робить фокус на можливості доручити Reasonix довгі автономні завдання і при цьому не втратити контроль. Працювати з ним можна в терміналі, десктопному застосунку, браузері чи прямо в редакторі через ACP, і всі сесії спільні.

Reasonix спершу показує план роботи, а потім на кожному кроці питає дозволу на читання, запис чи виконання команд. Кожен «хід» зберігається як контрольна точка поза git, тож навіть після кількох годин роботи можна скасувати будь-яку зміну, не зачіпаючи історію комітів. Агента легко розширювати через MCP-сервери та власні навички.

Muse Spark 1.2 та Code
https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
https://dev.meta.ai/
Meta теж входить в простір код-асистентів. Muse Spark 1.2 це оновлення моделі, спеціально дотреноване на кодінг та використання власної харнес Muse Code. Покращення в генерації коду, debugging, розумінні великих репозиторіїв і long-horizon задачах.

Muse Code поки у beta, це термінальний код-агент (macOS/Linux, Windows поки немає). Підтримує асинхронні фонові агенти, режим планування (/plan, /grill, /goal), постійні субагенти та журнал подій (event-log) для безпечного перезапуску довгих сесій. Модель доступна в Muse Code і Meta Model API (є дешевший contributor-tier з використанням даних).

https://www.youtube.com/watch?v=c-V4MrY03Mc

Автор https://aicodingdaily.com/leaderboard протестував Muse Spark 1.2 на 15 кодинг-промптах (5 промптів × 3 проєкти: Flutter/Dart, синхронізація даних з мобільного додатку в API, імпорт CSV на PHP). Не через Muse Code, а через Open Code та OpenRouter, з вимірюванням швидкості та реальної вартості. Модель досить повільна й доволі дорога для таких результатів. Каже, що за такі гроші вже є значно кращі варіанти: DeepSeek V4 Flash навіть після підвищення цін, Grok 4.5 тощо.

Qwen 3.8 Max
https://artificialanalysis.ai/models/qwen3-8-max
Нова flagship-модель від Alibaba (2.4T MoE). На Artificial Analysis Intelligence Index спочатку показувала топ-результати (1–2 місце), після оновлення методики тестування опустилася на 9 місце, нижче за Kimi K3. Модель досить «балакуча» (багато токенів). Обіцяють відкриття вагів найближчим часом.

Тут є тонкощі, що таку велику відкриту модель звичайним людям не запустити локально, тому багато хто зараз на невеликих Qwen 3.5 та Qwen 3.6.

Вже декілька місяців нові моделі вже можуть працювати годинами самостійно й генерувати доволі складні проекти.

ШІ спалює грощі
https://www.tomshardware.com/tech-industry/artificial-intelligence/amazon-accidentally-spent-usd1-8-million-using-claude-for-menial-coding-task-went-860-percent-over-budget-catastrophically-expensive-coding-blunders-discovered-in-internal-amazon-ai-usage-metrics
Amazon випадково витратив $1.8 млн на Claude Sonnet для простого завдання (зіставлення авторів з товарами). Бюджет перевищили на 860%, помилку помітили лише через 5 місяців, проєкт так і не запустили. Й такий баг, що раніше коштував би копійки, тепер спалює сотні тисяч доларів через token-based тарифікацію. Звісно за це ніхто грощі не повертає - багатіють провайдери, які в своїх рекламах спокушають запускати все більше агентів.

Програми надалі стають гіршими
https://ptrchm.com/posts/nothing-works-and-everyone-is-euphoric/
Автор іронічно описує нинішню хвилю захоплення ШІ як своєрідний масовий психоз. Нам постійно обіцяють, що штучний інтелект радикально підвищить продуктивність, автоматизує програмування і зробить програмне забезпечення якіснішим. Але якщо створення коду майже вирішене, то чому програми навколо нас продовжують ставати гіршими?

Оновлення викликають страх, інтерфейси деградують, баги множаться - банківський застосунок, який постійно вимагає повторної авторизації; Slack, що краде фокус вікна; сайт LG, де форма гарантійного звернення ламається в самому кінці; мультимедійна система автомобіля, яка після оновлення стала ще менш надійною та навіть заважає безпечному керуванню.

Проблема не в нестачі інструментів. Команди, які створюють ці великі продукти, майже напевно мають доступ до найсучасніших моделей ШІ. Текст не є анти-ШІ маніфестом. Навпаки, автор вважає, що ШІ дає розробникам надзвичайні можливості - маленькі команди отримують шанс створювати якісні, прості та надійні продукти, які раніше були їм не під силу.

Обговорення
https://news.ycombinator.com/item?id=49033004
Велика дискусія на HN під 700 коментарів. Люди масово підтверджують: оновлення софту тепер викликають тривогу, а не радість. ШІ не зробив масові програм кращими — він просто прискорив виробництво посереднього коду та безвідповідальність (це ШІ згенерував, а не ми).

Розрив тести/реальність
https://www.devopsdigest.com/are-ai-coding-tools-hitting-a-ceiling
BlueOptima провела дослідження BARE (AI Refactoring Evaluation) — тестувала 57 моделей на реальних задачах покращення maintainability (рефакторинг production-коду, зменшення складності, покращення структури без зміни поведінки).

Висновок. Моделі надалі все краще проходять синтаксичні перевірки коду (> 80%), але майже не вміють робити зміни, які реально покращують підтримуваність коду. Також є цікавий висновок про плато: останні релізи frontier-моделей майже не покращують результати на цих задачах (застрягли в діапазоні 17–23%).

ШІ робить прототипи
https://weeraman.com/the-prototype-isnt-the-product/
https://news.ycombinator.com/item?id=49132130
ШІ чудово робить швидкі прототипи, але прототип ≠ продукт. Сама відстань від «працює на ноутбуці» до масової production-ready системи майже не скоротилася: архітектура, масштабування, обробка помилок, безпека, підтримка — усе це вимагає інженерного судження відповідальних людей. Без глибокого розуміння коду ШІ-згенерований проект не зможе вийти зі стадії прототипу в стабільний продукт.

Нові анонсі моделей якраз фокусуються на тому, що код на виході стає все краще, без багів та помилок - звісно тоді модель все довше може генерувати все більше коду, який проходить всі перевірки. Але чи стає у цих моделей краще розуміння самої роботи програміста?

Open-source skills контролю ШІ
https://github.com/mattpocock/skills
Ці Skills перетворюють AI з «помічника-імпровізатора» на керований інструмент інженерного процесу. Вирішує реальні болі роботи з AI: зменшує хаос і галюцинації, економить токени, масштабується та підвищує передбачуваність. LLM швидко «тупішає» через деградацію уваги на великих сесіях, тому роботу пропонує свідомо дробити, зберігати що вже розуміємо і передавати контекст через документи, а не тримати все в одній довгій сесії.

Передає знання через CONTEXT.md і ADR — агент і команда говорять однією мовою. Треба запускати skills вручну (це свідомий дизайн), та вкласти час на налаштування. Найкраще працює з сильними моделями + хорошим agent harness (Claude Code тощо). Найбільший виграш — на середніх і великих задачах, де важливі якість, відтворюваність і контроль над контекстом.

Відео від Matt Pocock це практичний туторіал по його популярному open-source репозиторію skills. Він показує повний цикл роботи з AI-агентами (Claude Code та іншими) для реальної інженерії.

https://www.youtube.com/watch?v=M6mYodf0dJM

Показує встановлення та налаштування репозиторію (/setup-matt-pocock-skills) — вибір issue tracker (GitHub, Linear, локальні markdown-файли тощо), triage-лейблів і domain-документації (CONTEXT.md + ADR).

Основний workflow:

  • Ask Matt — роутер, який підказує, з чого почати.
  • Grill with docs — глибоке інтерв’ю агента, яке уточнює ідею, досліджує код і оновлює domain-документацію.
  • To-spec — стиснення розмови в детальний spec (problem statement, user stories, implementation/testing decisions).
  • To-tickets — розбиття spec на вертикальні «tracer-bullet» тікети (кожен вміщається в «smart zone» контексту ~100–140k токенів).
  • Implement + code-review — реалізація з TDD-елементами та перевіркою.

Демонструє через рефакторинг / прибирання legacy-коду. Grill with docs → агент досліджує namespace, задає 6–20 питань → shared plan → to-spec → to-tickets чи implement, якщо вміщається в smart zone.

Kimi K3 стала настільки популярна, що компанія закрила реєстрацію нових користувачів на підписні плани. Довго було написано просто "Sold Out", а зараз список очікування.

Opus 5 часто помиляється
https://www.anthropic.com/news/claude-opus-5
https://news.ycombinator.com/item?id=49038433
24 липня Anthropic випустила Claude Opus 5 — близька до Fable 5 за показниками на тестах, але дешевше. У демо Anthropic модель без доступу до «перегляду» креслення сама пише CV-пайплайн з пікселів і збирає 3D FreeCAD-модель; чинить root cause у package manager, який інші моделі «латають» лише на поверхні.

На практиці вийшла проблема саме в цій надмірній агентності. Забули пароль до Postgres — замість питання піднімає Kind-кластер. Попросили не чіпати sandbox — ламає правила. Пише specs/docs/research гірше, бо йде «робити», а не уточнювати. На code review бувають хибні спрацьовування. Часто спалює токени на винахідливі, але непотрібні обходи.

Ефект Kimi K3
https://stephen.bochinski.dev/blog/2026/07/18/the-kimi-k3-moment/
Stephen Bochinski описує те, що багато хто відчуває зараз: на звичайному кодингу K3 і Claude Fable майже не відрізнити бо та сама якість, схожа кількість токенів. Але ціна ні! Ширший сюжет блогу — провал США ШІ регулювання: Fable різали й гатили safeguard’ами, а китайська open frontier-модель без цих обмежень у відкритому доступі. Висновок автора жорсткий: тепер немає причини платити за Claude, якщо K3 тримає якість.

Kimi K3 на 256k дешевше
https://news.ycombinator.com/item?id=49101852
https://www.kimi.com/code/docs/en/kimi-code/models
Moonshot випустила k3-256k у Kimi Code: та сама якість у межах 256k, але у 2 рази менше ціна/квоти, ніж з 1M контекстом. Але тримає це для поточних підписників, щоб не повторити Anthropic-сценарій «приймаємо всіх і тихо ріжемо ліміти».

Локально K3 усе одно не про «ноут»: 1.5TB VRAM на MXFP4. Тому 256k-скидка важлива саме в cloud/subscription, не в self-host. Логіка та сама, що в OpenAI з порогом 272k — довгий KV-cache дорогий, тож окремий SKU з меншим max context дешевше обслуговувати. Перехід 256k → 1M не збиває кеш (за їхньою докою) — можна стартувати дешево й підняти вікно, коли реально треба.

Kimi K3 виклали
https://huggingface.co/moonshotai/Kimi-K3
https://news.ycombinator.com/item?id=49065752
https://huggingface.co/chat/models/moonshotai/Kimi-K3
Обіцянку з анонсу виконали: повні ваги на Hugging Face під Kimi K3 License. 2.8T MoE (активує 16 з 896 experts, 104B active), 1M context, нативне vision (MoonViT-V2), KDA + AttnRes, native MXFP4. Є chat на HuggingChat. Локально зараз мало кто зможе таке запустити, але вже підтягнулися великі GPU хмарні провайдери.

Поєднання Kimi K3 + Fable
https://fireworks.ai/blog/kimik3-fable
Fireworks прогнали 1030 agentic задач (SWE, terminal, algo, multi-lang, legal) через K3 і Fable 5 в одному harness. Вийшо, що на SWE майже нічия (K3 92.4% vs Fable 92.6%), але спеціалізація різна — K3 сильніший на symbolic math, dev tooling, long terminal (security/crypto/sysadmin); Fable — web, data viz, ширший multi-lang.

Висновок статті: краще не коли одна SoTA модель робить все. Open (K3) — запускає, premium (Fable) — дороблює; роутер це все перемикає. Oracle routing (обрати дешевшу правильну модель) дає до 93% точність і до 50× нижчу вартість за Fable на довгих завданнях.

Не модель Fugu
https://sakana.ai/fugu/
Sakana Fugu — це не одна LLM, а мульті-агента система як модель назовні: один OpenAI-compatible API, всередині динамічна оркестрація пулу чужих frontier-моделей. Які саме моделі і як роутить тут закрита інформація. Це інший полюс того самого тренду, що й Fireworks routing.