CodeWithLLM-Updates
-
🤖 Інструменти ШІ для програмування: практичні приклади, покрокові інструкції та реальні застосування LLM. Навчіться ефективно працювати з сучасними асистентами програмування.

Офіційне середовище для агентів від DeepSeek на мікроядрі Cordis.

DeepSeek Harness (dsh)
https://github.com/deepseek-ai/deepseek-harness
https://www.deepseek.com/harness/en/
13 серпня разом з релізом DeepSeek-V4-Pro-0813 вийшов офіційний відкритий харнес від DeepSeek — dsh на мікроядрі Cordis. Його спочатку створив розробник Shigma як основу для фреймворку чат-ботів Koishi. Згодом виділили в окремий проект (Cordiverse), а дослідники з Пекінського університету та DeepSeek формалізували його математичну модель у статті про «просторово-часову компонованість». Описали можливість динамічно підключати, оновлювати й вивантажувати плагіни прямо під час роботи програми без її перезапуску.

Архітектура побудована за принципом «усе є плагіном»: цикл роботи агента, інструменти, ізольована пісочниця та інтерфейс користувача реалізовані як окремі модулі зі зворотними ефектами (чистим скасуванням змін) і спільним контекстом. Ліцензія MIT, проект поки на стадії раннього доступу для розробників із можливими змінами в API. У репозиторії є навчальні посібники для створення власних розширень, а спільнота вже публікує додаткові плагіни з тегом dsh-plugin.

https://www.youtube.com/watch?v=RWp5cejTApU

У практичному огляді автор демонструє реальний робочий процес у веб-інтерфейсі dsh. Головні корисні можливості з відео:

  • Вбудований маркетплейс (Harness Market) — встановлення розширень, додаткових інструментів та сторонніх провайдерів моделей прямо з інтерфейсу.
  • Режими роботи (Code, Minimal, Creator) — зокрема режим Creator для налаштування власних пресетів агентів та інспекції стану системи.
  • Керування робочими просторами та живий контроль — організація проєктів за папками, а також можливість ставити виконання на паузу та коригувати цілі на льоту без перезапуску всієї сесії.

Обговорення
https://news.ycombinator.com/item?id=49285244
На Hacker News проект обговорюють насамперед як приклад інженерії агентних систем. Головний висновок розробників — продумане середовище (цикли зворотного зв'язку, контроль контексту та виклики інструментів) зараз дає не менший ефект, ніж оновлення самої моделі.

Також порівнюють з Reasonix (компактний агент на Go, оптимізований під DeepSeek, MIT): Reasonix націлений на максимальну економію завдяки стабільному префіксному кешуванню для довгих сесій (часто менше $1–2 на задачу), тоді як dsh є більш універсальним, розширюваним та офіційним каркасом.

Змини в доступних моделях. OpenAI відключає Cursor після його покупки SpaceX.

OpenAI розриває контракт з Cursor!
https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/
https://cursor.com/blog/joining-spacex
14 серпня Cursor (Anysphere) офіційно став частиною SpaceX — all-stock угода на ≈$60 млрд з доступом до GPU-інфраструктури Colossus для тренування. 28 серпня OpenAI повідомила SpaceX, що згортає контракт на постачання своїх моделей у Cursor з датою відключення 12 листопада 2026 — це максимальний notice за їхнім кастомним договором.

Рішення пояснюють недовірою: OpenAI пише, що не може бути впевнена, що SpaceX дотримуватиметься ToS, згадуючи порушення контракту Twitter (тепер частина SpaceX) після купівлі Маском та визнання під присягою цьогоріч, що xAI дистилювала дані OpenAI для тренування. Окремо згадують новий рівень відповідальності для наступної моделі Astra — тому майбутні моделі Cursor не отримає як частину підписки, хоча через власний API-ключ залишається.

Обговорення
https://news.ycombinator.com/item?id=49486172
Колись Cursor цінували саме як обгортку навколо топ моделей OpenAI/Claude, а тепер вона стає майданчиком для розгортання Grok від Маска. Вони заплатили не за IDE, а за мільярди промптів і код-контекстів для тренування. Люди гадають чи забанить Anthropic тепер Cursor. Засновник Cursor у твіті пише, що мовляв моделі OpenAI це лише ≈5% трафіку, але в коментах уточнюють що по revenue це значно більше. Частина розробників шукають куди мігрувати — JetBrains, Zed, OpenCode, Codex, бо втрачати можливість перемикати Sol/Terra для планування + Composer/Claude для реалізації не хочуть.

В OpenCode Zen зник безкоштовний DeepSeek Flash
Користувачі помітили, що в безкоштовному шлюзі OpenCode Zen зник deepseek-v4-flash-free, а якщо була підключена через API то почала видавати помилку "401 No payment method. Add a payment method here" — модель, через яку багато хто (та й я) робив 100% безкоштовний якісний код останні тижні. Офіційного анонсу немає, в issues та на Reddit просто "unavailable". На самому DeepSeek API з 16 серпня там новий peak/off-peak прайсинг (пік 01:00–04:00 та 06:00–10:00 UTC у 2× дорожче, загалом +3.5–4.7×).

GLM-5.3, GLM-5.3 Flash як ox-alpha та Qwen 3.8 Flash
https://z.ai/blog/glm-5.3
https://z.ai/blog/glm-5.3-flash
https://qwen.ai/blog?id=qwen3.8-flash-next
Z.ai 14 серпня випустила GLM-5.3 на тій же 743B базі що GLM-5.2, все за рахунок post-training. А 26 серпня вийшов GLM-5.3 Flash вже на новій базі — MoE 320B total / 18B активних, перший відкритий frontier з гібридним sparse+linear attention (KV-кеш у ≈4.4× менший), нативна мультимодальність (текст+картинка+відео), 1M контекст, MIT. До анонсу його тиждень ганяли анонімно на OpenRouter та в OpenCode Zen як stealth/ox-alpha — став найпопулярнішою моделлю тижня, на рівні Claude Opus 4.8 за ≈1/10 ціни.

Того ж 26 серпня Alibaba викотив Qwen3.8-Flash-Next (в API — Qwen3.8-Flash) — прев'ю архітектури для Qwen4: MoE 125B + 51B N-gram memory + 4B MTP, лише 6B активних, Qwen Sparse Attention на мікро-блоках, gated residual, 262K нативно (тягнеться до 1M), мультимодальність, ліцензія Qwen 1.0.

Voyage Code 4 — ембедінги заточені під агентів
https://blog.voyageai.com/2026/08/13/voyage-code-4/
З грудня 2024 voyage-code-3 був однією з найпопулярніших моделей Voyage взагалі — хітом саме серед код-ембедінгів для RAG і семантичного пошуку, його масово підключили код-асистенти (Cursor, Continue, Cody та інші) як базу для пошуку релевантних файлів і сніпетів. Але зараз більшість запитів роблять уже не люди, а агенти.

Нове покоління лінійки Voyage Code, наступник code-3, перезібраний саме під агентів. На практиці це означає що модель помітно частіше знаходить потрібний файл з першої спроби: на 19 нових агентних бенчмарках (held-out репо, NDCG@10 — чим вище, тим краще знаходить релевантне) вона приблизно на третину краще за найближчих конкурентів Cohere та Gemini і майже в півтора раза краще за OpenAI. При цьому вона гнучка і дешевша.

Vercel та Slack теж хочуть бути на ринку кодінг інструментів.

fx — крихітний нативний код-агент
https://fx.sh/
https://github.com/vercel-labs/fx
fx яу відповідь на роздуття агентних TUI від Vercel Labs це поки що експерементальний харнес у CLI на Zig, бінарник 6–8 МБ, старт за мікросекунди, мінімальний системний промпт, UI ближче до Unix-шелла, ніж до «IDE в терміналі». Apache-2.0 ліцензія. Є Wasm-збірка (демо прямо в браузері), skills, MCP, субагенти, ACP для редакторів.

Моделі через Vercel AI Gateway чи підписку Codex (fx login codex) або Grok (fx login grok); за замовчуванням зараз у демо стоїть glm-5.2. Поки v0.0.5, «use at your own risk».

Slack Code: агентний кодинг для команд
https://www.salesforce.com/introducing-slack-code/
Salesforce запускає Slack Code — окремі code канали всередині Slack, де можна тегнути код-агента (Claude, Devin, GitHub Copilot, ChatGPT, агенти Vercel) і разом дивитися дифи, прев’ю та апрувити роботу, не виходячи з чату. Є вкладка Agents і «Add to Slack» для агентів з Lovable, n8n, LangChain тощо. На старті працює з агентами партнерів і доступний на будь-якому плані Slack — але потрібен окремий доступ до кожного агента.

Ідея проста: зараз розмова людини з агентом відбувається в приватній вкладці, команда цього не бачить, контекст губиться. У Slack Code канал створюється під одну задачу, коли непотрібно - архівується, історія лишається як лог. Показують сценарій, де PM сам тегає агента на баг, інженер лише перевіряє диф і дає добро на PR.

Proliferate: open-source IDE для кількох агентів
https://github.com/proliferate-ai/proliferate/releases
https://proliferate.com/
Proliferate це спроба зібрати команду агентів з ізоляцією гілок і спільним рев’ю. Проект open-source (AGPL-3.0), де в одному воркспейсі паралельно крутяться нативні харнеси: Claude Code, Codex, OpenCode, Cursor, Grok. Кожна задача — окремий git worktree (або хмарний sandbox, який живе, коли ноутбук закритий), є субагенти, спільні MCP/skills і beta workflows (нічні рев’ю, triage з CI, бампи залежностей).

jcode під спільну работу агентів
https://jcode.sh/
https://github.com/1jehuang/jcode
https://www.ycombinator.com/companies/jcode
jcode — open-source (MIT) термінальний агент, написаний на Rust, від Jeremy Huang, Y Combinator. Місія проекту розпаралелити десятки задач одночасно. Ключова фішка це наднизьке споживання пам’яті, за вимірами проекту 10.4 MB на додаткову сесію проти 212.7 MB у Claude Code, тобто 10 сесій jcode менше половини одного Claude Code.

TUI при цьому повноцінний з підтримкою зображень, LaTeX/math, діаграми/Mermaid, є live-прогрес фонових-задач, swarm-режим з нотифікаціями про конфлікти файлів і меседжингом між агентами.

Orca від Stably
https://onorca.dev/
https://github.com/stablyai/orca
Orca це окремий open-source ADE (Agent Development Environment, MIT). Це десктоп-IDE для паралельних агентів: кожна задача — окремий git worktree + свій термінал (Ghostty-inspired) + браузер, можна ганяти Claude Code, Codex, OpenCode, Cursor side-by-side, є мобільні компаньйони та Orca CLI.

https://www.youtube.com/watch?v=vZUUHMCBoQg

Практична цінність це Workspace Board для роздачі задач різним агентам та єдиний Diff Review для рев’ю/мерджу без стрибків між гілками, та вбудований Chromium з Design Mode (інспекція DOM → копія розмітки агенту для точкового фіксу верстки), спліти вкладок, інтегрований редактор, автоматизація git-workflow (створення worktree через Cmd+N + setup-скрипт pnpm install, стейджинг/коміти/PR).

Тиждень міні-апдейтів: Grok 4.6, Gemini 3.7 Flash, DeepSeek V4-Pro 0813, GLM-5.3, Qwen 3.8 27B, MAI-Code 1.1 Flash і Muse Glimmer — всі підтягнули генерацію коду без зміни архітектури.

Grok 4.6
https://x.ai/news/grok-4-6
xAI випустила 12 серпня чисто post-training оновлення на тому ж ≈1.5T базі, що й Grok 4.5. З точки зору генерації коду це 1 публічний результат на FrontierCode v1.1 Extended (61.3%), APEX-SWE 56.4%, CursorBench v3.2 підріс з 66.7% до 69.9%. Головне покращення — модель більше самостійно тестує й перевіряє свій код у довгих агентних сесіях, тож витрачає значно менше марних кроків (≈53 ходи проти ≈103 у Claude Opus 5).

Слабке місце як і раніше — робота в терміналі (Terminal-Bench 3.0 лише 26%). Елон пише що Grok 4.7 вже за декілька тижнів. Оновлення потрохи рухають модель все вище у рейтингу artificialanalysis й наближують до найкращіх.

DeepSeek V4-Pro 0813
https://api-docs.deepseek.com/updates/
13 серпня Pro-рівень нарешті отримав той самий агентний post-training, що вже був у V4-Flash 0731 — і це вже повноцінний production-реліз, а не preview. Операційно додали підтримку OpenAI Responses API, нарешті one-click налаштування Codex і керування рівнем reasoning (low/high/max). Ваги для 0813 не публікували.

Gemini 3.7 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Google 13 серпня, за три тижні після 3.6 Flash. Найбільший стрибок усієї Flash-лінійки саме в кодінгу: DeepSWE v1.1 з 49.0% до 65.3% (якщо вірити тестам), FrontierCode 1.1 Main з 34.4% до 43.6% а в таблиці Google це краще за Claude Sonnet 5 і GPT-5.6 Terra - оце так. Додатково майже вдвічі дешевша на старті ($0.75/$3.75 за M токенів до кінця 2026), контекст 1M.

GLM-5.3
https://z.ai/blog/glm-5.3
Z.ai 14 серпня, та сама 743B база, що й GLM-5.2, всі здобутки — з post-training (IndexShare + SAO). Код: +50% на внутрішньому Z.ai Code Bench, Terminal-Bench 3.0 28.3% (найкращий показник серед open-weights, для порівняння GLM-5.2 мав 4.6%), DeepSWE 1.1 66.9%. Говорять, що кіберспроможність (CyberGym 84.5%, ExploitBench з 24.4% до 54.4%) настільки зросла, що випуск вагів затримали на два тижні для safety-перевірки. Поки лише GLM Coding Plan та ZCode.


Qwen 3.8 27B
https://huggingface.co/Qwen/Qwen3.8-27B
Alibaba 14 серпня, щільна (dense) мультимодальна 27B-модель під Apache 2.0 — дистиляція флагманського Qwen3.8 Max для локального запуску. Все тести показують помітний ріст над Qwen3.6-27B, чого ми й чекали. Рідний контекст 262K (розширюється до 1M через YaRN), тягнеться на звичайних топових GPU та Ryzen AI Max.

MAI-Code 1.1 Flash
https://microsoft.ai/models/mai-code-1-flash/
https://github.blog/changelog/2026-08-11-mai-code-1-1-flash-available-in-github-copilot/
Microsoft 11 серпня оновила свою невелику код-модель (MoE з ≈5B активних) і запустила в GitHub Copilot. Оновлення зроблене під реальні скарги розробників, тому дотягнули +22% на Terminal-Bench 2.1 і +15% на .NET, плюс native vision (розуміє скріншоти й діаграми). Для рутинних легких задач стало важливішим інше: на 25% ефективніша за токенами і вчетверо дешевша (на 73% нижчий список, ніж у 1.0) — тренована з нуля на чистому enterprise-датасеті без дистиляції.

Muse Glimmer
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
Meta 10 серпня вперше за 16 місяців (після Llama 4) випустила знову open-weights модель — 30B під Apache 2.0, дистиляція закритого Muse Spark для локального запуску на одній споживчій GPU (4-bit квантування ≈ 17GB VRAM). Для коду лідирує в своєму класі за агентними задачами, але програє Qwen3.6-27B (а там вже 3.8 вийшла). Цікаво, що разом з нею Цукерберг пообіцяв колись відкрити ваги і більш потужної Muse Spark 1.2.

Google посилив лінійку Flash, DeepSeek випустив офіційний V4 Flash з помітно кращими агентними здібностями, Meta зайшла в код-агенти з Muse, Alibaba оновила Qwen Max

Оновлення Gemini 3.6 Flash, 3.5 Flash Cyber
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Тепер є Gemini 3.5 Flash Cyber це спеціалізована модель для кібербезпеки (пошук, валідація та патчинг вразливостей) та вона доступна обмежено для урядів і довірених партнерів. Повна Gemini 3.5 Pro ще закрито тестується.

А ось Gemini 3.6 Flash тепер основна «робоча» модель. Краще генерує код (іноді краще ніж Gemini 3.1 Pro), працює з мультимодальними задачами, при цьому витрачає на 17% менше output-токенів (Artificial Analysis), а на деяких бенчмарках (наприклад DeepSWE) економія сягає 65%.

DeepSeek V4 Flash 0731
https://api-docs.deepseek.com/updates/#date-2026-07-31
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://arcprize.org/results/deepseek-v4-flash-0731
Офіційний реліз (замість preview) моделі з 284–304B параметрів (13B активних) та 1M контекстом вікном від DeepSeek - зараз у публічній бета на API. Ваги відкриті (MIT). Як й у Google з значно покращені агентні здібності й Flash тепер обходить власний V4-Pro Preview на більшості агентних бенчмарків, незважаючи на менший розмір та ціну.

Обіцяють й оновлення DeepSeek-V4-Pro. Модель адаптована під Codex і Responses API, але зараз можно налаштувати тільки deepseek-v4-flash - підтримка deepseek-v4-pro очікується теж найближчим часом. Компанія анонсувала підвищення цін на API (зараз вони надто низькі), але сама модель залишається відкритою для завантаження.

Обговорення
https://news.ycombinator.com/item?id=49214008
Люди обговорюють, наскільки модель дешева плюс достатньо розумна, що відкриває нові сценарії використання, які раніше були дорогими. Хтось уже ганяє на орендованих GPU (RTX 6000, MI300X тощо). Один користувач з 5–6 активними сесіями (фактично 12 потоків) витрачає менше $5 на день.

DeepSeek-центрованний ШІ агент
https://reasonix.io/
https://github.com/esengine/deepseek-reasonix
Локальний агент (один Go-бінарник без залежностей, MIT), оптимізований саме під DeepSeek з cache-first loop. Проект робить фокус на можливості доручити Reasonix довгі автономні завдання і при цьому не втратити контроль. Працювати з ним можна в терміналі, десктопному застосунку, браузері чи прямо в редакторі через ACP, і всі сесії спільні.

Reasonix спершу показує план роботи, а потім на кожному кроці питає дозволу на читання, запис чи виконання команд. Кожен «хід» зберігається як контрольна точка поза git, тож навіть після кількох годин роботи можна скасувати будь-яку зміну, не зачіпаючи історію комітів. Агента легко розширювати через MCP-сервери та власні навички.

Muse Spark 1.2 та Code
https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
https://dev.meta.ai/
Meta теж входить в простір код-асистентів. Muse Spark 1.2 це оновлення моделі, спеціально дотреноване на кодінг та використання власної харнес Muse Code. Покращення в генерації коду, debugging, розумінні великих репозиторіїв і long-horizon задачах.

Muse Code поки у beta, це термінальний код-агент (macOS/Linux, Windows поки немає). Підтримує асинхронні фонові агенти, режим планування (/plan, /grill, /goal), постійні субагенти та журнал подій (event-log) для безпечного перезапуску довгих сесій. Модель доступна в Muse Code і Meta Model API (є дешевший contributor-tier з використанням даних).

https://www.youtube.com/watch?v=c-V4MrY03Mc

Автор https://aicodingdaily.com/leaderboard протестував Muse Spark 1.2 на 15 кодинг-промптах (5 промптів × 3 проєкти: Flutter/Dart, синхронізація даних з мобільного додатку в API, імпорт CSV на PHP). Не через Muse Code, а через Open Code та OpenRouter, з вимірюванням швидкості та реальної вартості. Модель досить повільна й доволі дорога для таких результатів. Каже, що за такі гроші вже є значно кращі варіанти: DeepSeek V4 Flash навіть після підвищення цін, Grok 4.5 тощо.

Qwen 3.8 Max
https://artificialanalysis.ai/models/qwen3-8-max
Нова flagship-модель від Alibaba (2.4T MoE). На Artificial Analysis Intelligence Index спочатку показувала топ-результати (1–2 місце), після оновлення методики тестування опустилася на 9 місце, нижче за Kimi K3. Модель досить «балакуча» (багато токенів). Обіцяють відкриття вагів найближчим часом.

Тут є тонкощі, що таку велику відкриту модель звичайним людям не запустити локально, тому багато хто зараз на невеликих Qwen 3.5 та Qwen 3.6.

Вже декілька місяців нові моделі вже можуть працювати годинами самостійно й генерувати доволі складні проекти.

ШІ спалює грощі
https://www.tomshardware.com/tech-industry/artificial-intelligence/amazon-accidentally-spent-usd1-8-million-using-claude-for-menial-coding-task-went-860-percent-over-budget-catastrophically-expensive-coding-blunders-discovered-in-internal-amazon-ai-usage-metrics
Amazon випадково витратив $1.8 млн на Claude Sonnet для простого завдання (зіставлення авторів з товарами). Бюджет перевищили на 860%, помилку помітили лише через 5 місяців, проєкт так і не запустили. Й такий баг, що раніше коштував би копійки, тепер спалює сотні тисяч доларів через token-based тарифікацію. Звісно за це ніхто грощі не повертає - багатіють провайдери, які в своїх рекламах спокушають запускати все більше агентів.

Програми надалі стають гіршими
https://ptrchm.com/posts/nothing-works-and-everyone-is-euphoric/
Автор іронічно описує нинішню хвилю захоплення ШІ як своєрідний масовий психоз. Нам постійно обіцяють, що штучний інтелект радикально підвищить продуктивність, автоматизує програмування і зробить програмне забезпечення якіснішим. Але якщо створення коду майже вирішене, то чому програми навколо нас продовжують ставати гіршими?

Оновлення викликають страх, інтерфейси деградують, баги множаться - банківський застосунок, який постійно вимагає повторної авторизації; Slack, що краде фокус вікна; сайт LG, де форма гарантійного звернення ламається в самому кінці; мультимедійна система автомобіля, яка після оновлення стала ще менш надійною та навіть заважає безпечному керуванню.

Проблема не в нестачі інструментів. Команди, які створюють ці великі продукти, майже напевно мають доступ до найсучасніших моделей ШІ. Текст не є анти-ШІ маніфестом. Навпаки, автор вважає, що ШІ дає розробникам надзвичайні можливості - маленькі команди отримують шанс створювати якісні, прості та надійні продукти, які раніше були їм не під силу.

Обговорення
https://news.ycombinator.com/item?id=49033004
Велика дискусія на HN під 700 коментарів. Люди масово підтверджують: оновлення софту тепер викликають тривогу, а не радість. ШІ не зробив масові програм кращими — він просто прискорив виробництво посереднього коду та безвідповідальність (це ШІ згенерував, а не ми).

Розрив тести/реальність
https://www.devopsdigest.com/are-ai-coding-tools-hitting-a-ceiling
BlueOptima провела дослідження BARE (AI Refactoring Evaluation) — тестувала 57 моделей на реальних задачах покращення maintainability (рефакторинг production-коду, зменшення складності, покращення структури без зміни поведінки).

Висновок. Моделі надалі все краще проходять синтаксичні перевірки коду (> 80%), але майже не вміють робити зміни, які реально покращують підтримуваність коду. Також є цікавий висновок про плато: останні релізи frontier-моделей майже не покращують результати на цих задачах (застрягли в діапазоні 17–23%).

ШІ робить прототипи
https://weeraman.com/the-prototype-isnt-the-product/
https://news.ycombinator.com/item?id=49132130
ШІ чудово робить швидкі прототипи, але прототип ≠ продукт. Сама відстань від «працює на ноутбуці» до масової production-ready системи майже не скоротилася: архітектура, масштабування, обробка помилок, безпека, підтримка — усе це вимагає інженерного судження відповідальних людей. Без глибокого розуміння коду ШІ-згенерований проект не зможе вийти зі стадії прототипу в стабільний продукт.

Нові анонсі моделей якраз фокусуються на тому, що код на виході стає все краще, без багів та помилок - звісно тоді модель все довше може генерувати все більше коду, який проходить всі перевірки. Але чи стає у цих моделей краще розуміння самої роботи програміста?

Open-source skills контролю ШІ
https://github.com/mattpocock/skills
Ці Skills перетворюють AI з «помічника-імпровізатора» на керований інструмент інженерного процесу. Вирішує реальні болі роботи з AI: зменшує хаос і галюцинації, економить токени, масштабується та підвищує передбачуваність. LLM швидко «тупішає» через деградацію уваги на великих сесіях, тому роботу пропонує свідомо дробити, зберігати що вже розуміємо і передавати контекст через документи, а не тримати все в одній довгій сесії.

Передає знання через CONTEXT.md і ADR — агент і команда говорять однією мовою. Треба запускати skills вручну (це свідомий дизайн), та вкласти час на налаштування. Найкраще працює з сильними моделями + хорошим agent harness (Claude Code тощо). Найбільший виграш — на середніх і великих задачах, де важливі якість, відтворюваність і контроль над контекстом.

Відео від Matt Pocock це практичний туторіал по його популярному open-source репозиторію skills. Він показує повний цикл роботи з AI-агентами (Claude Code та іншими) для реальної інженерії.

https://www.youtube.com/watch?v=M6mYodf0dJM

Показує встановлення та налаштування репозиторію (/setup-matt-pocock-skills) — вибір issue tracker (GitHub, Linear, локальні markdown-файли тощо), triage-лейблів і domain-документації (CONTEXT.md + ADR).

Основний workflow:

  • Ask Matt — роутер, який підказує, з чого почати.
  • Grill with docs — глибоке інтерв’ю агента, яке уточнює ідею, досліджує код і оновлює domain-документацію.
  • To-spec — стиснення розмови в детальний spec (problem statement, user stories, implementation/testing decisions).
  • To-tickets — розбиття spec на вертикальні «tracer-bullet» тікети (кожен вміщається в «smart zone» контексту ~100–140k токенів).
  • Implement + code-review — реалізація з TDD-елементами та перевіркою.

Демонструє через рефакторинг / прибирання legacy-коду. Grill with docs → агент досліджує namespace, задає 6–20 питань → shared plan → to-spec → to-tickets чи implement, якщо вміщається в smart zone.

Kimi K3 стала настільки популярна, що компанія закрила реєстрацію нових користувачів на підписні плани. Довго було написано просто "Sold Out", а зараз список очікування.

Opus 5 часто помиляється
https://www.anthropic.com/news/claude-opus-5
https://news.ycombinator.com/item?id=49038433
24 липня Anthropic випустила Claude Opus 5 — близька до Fable 5 за показниками на тестах, але дешевше. У демо Anthropic модель без доступу до «перегляду» креслення сама пише CV-пайплайн з пікселів і збирає 3D FreeCAD-модель; чинить root cause у package manager, який інші моделі «латають» лише на поверхні.

На практиці вийшла проблема саме в цій надмірній агентності. Забули пароль до Postgres — замість питання піднімає Kind-кластер. Попросили не чіпати sandbox — ламає правила. Пише specs/docs/research гірше, бо йде «робити», а не уточнювати. На code review бувають хибні спрацьовування. Часто спалює токени на винахідливі, але непотрібні обходи.

Ефект Kimi K3
https://stephen.bochinski.dev/blog/2026/07/18/the-kimi-k3-moment/
Stephen Bochinski описує те, що багато хто відчуває зараз: на звичайному кодингу K3 і Claude Fable майже не відрізнити бо та сама якість, схожа кількість токенів. Але ціна ні! Ширший сюжет блогу — провал США ШІ регулювання: Fable різали й гатили safeguard’ами, а китайська open frontier-модель без цих обмежень у відкритому доступі. Висновок автора жорсткий: тепер немає причини платити за Claude, якщо K3 тримає якість.

Kimi K3 на 256k дешевше
https://news.ycombinator.com/item?id=49101852
https://www.kimi.com/code/docs/en/kimi-code/models
Moonshot випустила k3-256k у Kimi Code: та сама якість у межах 256k, але у 2 рази менше ціна/квоти, ніж з 1M контекстом. Але тримає це для поточних підписників, щоб не повторити Anthropic-сценарій «приймаємо всіх і тихо ріжемо ліміти».

Локально K3 усе одно не про «ноут»: 1.5TB VRAM на MXFP4. Тому 256k-скидка важлива саме в cloud/subscription, не в self-host. Логіка та сама, що в OpenAI з порогом 272k — довгий KV-cache дорогий, тож окремий SKU з меншим max context дешевше обслуговувати. Перехід 256k → 1M не збиває кеш (за їхньою докою) — можна стартувати дешево й підняти вікно, коли реально треба.

Kimi K3 виклали
https://huggingface.co/moonshotai/Kimi-K3
https://news.ycombinator.com/item?id=49065752
https://huggingface.co/chat/models/moonshotai/Kimi-K3
Обіцянку з анонсу виконали: повні ваги на Hugging Face під Kimi K3 License. 2.8T MoE (активує 16 з 896 experts, 104B active), 1M context, нативне vision (MoonViT-V2), KDA + AttnRes, native MXFP4. Є chat на HuggingChat. Локально зараз мало кто зможе таке запустити, але вже підтягнулися великі GPU хмарні провайдери.

Поєднання Kimi K3 + Fable
https://fireworks.ai/blog/kimik3-fable
Fireworks прогнали 1030 agentic задач (SWE, terminal, algo, multi-lang, legal) через K3 і Fable 5 в одному harness. Вийшо, що на SWE майже нічия (K3 92.4% vs Fable 92.6%), але спеціалізація різна — K3 сильніший на symbolic math, dev tooling, long terminal (security/crypto/sysadmin); Fable — web, data viz, ширший multi-lang.

Висновок статті: краще не коли одна SoTA модель робить все. Open (K3) — запускає, premium (Fable) — дороблює; роутер це все перемикає. Oracle routing (обрати дешевшу правильну модель) дає до 93% точність і до 50× нижчу вартість за Fable на довгих завданнях.

Не модель Fugu
https://sakana.ai/fugu/
Sakana Fugu — це не одна LLM, а мульті-агента система як модель назовні: один OpenAI-compatible API, всередині динамічна оркестрація пулу чужих frontier-моделей. Які саме моделі і як роутить тут закрита інформація. Це інший полюс того самого тренду, що й Fireworks routing.

Grok скандал із «тихим» вивантаженням коду, потім — відкритий код як спроба повернути довіру.

Grok CLI та стеження
https://www.internationalcyberdigest.com/xais-grok-build-cli-uploads-entire-git-repositories-to-a-google-cloud-bucket/
https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547
Відразу кілька людей написали репорти, що Grok Build CLI при старті сесії детерміновано (не «агент сам вирішив») пакує поточну директорію / git-репозиторій і заливає його в інтернет на Google Cloud Storage (grok-code-session-traces). Один користувач запустив grok з home directory і побачив, що пішли SSH-ключі, password manager, документи, фото — всі його файли.

Люди почали досліджувати. Це НЕ поведінка моделі. Налаштування приватності «Improve the model» / /privacy тільки керує чи будуть данні використані для навчання, а не тим, чи файли взагалі будуть скопійовані з машини. Це робить код harness'а, аналіз (cereblab, grok 0.2.93) показав два канали:

  1. Model turn (/v1/responses) — те, що агент реально прочитав (у т.ч. .env).
  2. Знімок всієї папки — окреме завантаження усього репозиторія включаючи git history, навіть файлів, які агенту сказали НЕ читати.

На 12 GB репо пішло ≈5.1 GiB у Google Cloud Storage при ≈192 KB на модель. Як вихід був локальний kill-switch: [harness] disable_codebase_upload = true у ≈/.grok/config.toml (+ env для telemetry). Але сервери xAI після розголосу цієї поведінки десь з 12 липня самі вимкнули завантаження. Маск пообіцяв повністю видалити раніше завантажені дані.

https://news.ycombinator.com/item?id=48892468
На HN тон жорсткий: не повинно «trust this directory» давати право «upload everything to vendor». Тому люди все еще за те, щоб агентів тримати у VM/container/окремому user й не допускати до свої машини.

Порівнюють з Cursor indexing (вони теж завантажували при старті всі файли), але там це було прописано в документації відкрито як необхідність більше швидкого створення embeddings.

Grok CLI відкрили код
https://x.ai/open-source
https://github.com/xai-org/grok-build
https://simonwillison.net/2026/Jul/15/grok-build/
Після скандалу SpaceXAI/xAI виклали код Grok Build на GitHub під Apache 2.0: Rust TUI + agent runtime (≈845k SLOC, ≈3% vendored). Репо — періодичний snapshot з внутрішнього monorepo (SOURCE_REV), зовнішні PR/issues не приймають. Можна збирати з source і ганяти local-first з власним inference. На практиці бінарники з CDN і open tree — різні речі, поки немає reproducible builds.

У коді лишилися сліди upload path (upload/gcs.rs), але session upload повертає session_state_upload_unavailable. Є порти tools з Codex/OpenCode (з THIRD-PARTY notices), terminal Mermaid renderer, system/subagent prompts.

Обговорення
https://news.ycombinator.com/item?id=48926590
На HN змішано: бачать стратегія відстаючого гравця та «відкрили, бо спіймали на непрозорій поведінці». Хвалять TUI (миша, smoothness). Спільнота вже ріже privacy-форки:

  • gork-build https://github.com/thedavidweng/gork-build (telemetry strip, block auto-update),
  • digi-grok / open-grok (multi-provider),
  • desktop Tauri-обгортки,
  • скрипти вимкнення telemetry.
    Але багато хто вважає, що все одно форки не мають змісту для інших моделей, бо під них вже краще взяти Pi / OpenCode.

Нарешті анонси моделей які роблять суттєвий крок уперед.

Величезна Kimi K3
https://www.kimi.com/blog/kimi-k3
Moonshot випустила Kimi K3 — open frontier дуже велику модель на 2.8T параметрів (MoE: активує 16 з 896 experts), з 1M контекстом і нативним розумінням зображень. Це перша open-модель класу ~3T. Налаштована для довгої агентної роботи, в презентації роблять акцент на генерацію простих 3д ігор.

Також у кейсах — оптимізація GPU-ядер, збірка MiniTriton-компілятора з нуля, 48-годинний прогін chip design. За їхніми бенчмарками вона трохи поступається Claude Fable 5 і GPT-5.6 Sol, але стабільно обходить Opus 4.8, GPT-5.5 і точно GLM-5.2. Тобто на зараз це трете місце у світі, K3 відстає від Fable 5 лише приблизно на 5%. За доброю китайскою традицією дешевша за США конкурентів.

На момент анонсу виклали не самі ваги моделі, а лише доступ через API, Kimi.com, Kimi Code та інші свої сервіси. У технічному блозі Moonshot пише, що повні ваги моделі будуть опубліковані до 27 липня 2026 року.

Обговорення
https://news.ycombinator.com/item?id=48935342
За Simon Willison це «найдорожчий пелікан» серед китайських моделей. Якщо K3 справді близько до Fable/Sol — то така ціна виправдана. Локально 2.8T майже нікому не підняти тому тут цінність у GPU клауді, а не в «на ноуті». В цілому довга суперечка про те, чи китайські лабораторії вже майже наздогнали Anthropic/OpenAI, чи ще суттєво відстають.

https://www.youtube.com/watch?v=QfCpRTLSOB4

Fable 5 повернули
https://www.anthropic.com/news/redeploying-fable-5
Після релізу 9 червня керівництво США наклала заборону на відкритий доступ до найпотужніших на сьогодні Anthropic моделей Fable 5 / Mythos 5 з необхідністю попередньої внутрішньої перевірки загроз безпеки. Anthropic вимкнула доступ усім, бо не могла перевіряти звідки користувач.

30 червня обмеження зняли; з 1 липня Fable 5 знову глобально в Claude, Claude Code, Cowork і Platform. Mythos 5 — лише для обмеженого кола США-організацій (Glasswing). Anthropic також продовжила пільговий період доступу до Fable 5 в межах підписних планів спочатку до 12 липня, а потім до 19 липня. Чи буде надалі доступ до моделі тільки за оплату токенів подивимося вже незабаром.

GPT-5.6 у трьох варіантах
https://openai.com/index/gpt-5-6/
OpenAI вивела сімейство GPT-5.6: Sol (передова), Terra (баланс, ~рівень GPT-5.5 при нижчій ціні), Luna (швидка/дешева, ~рівень GPT-5.4). Добре що з'явився явний вибір замість «одна модель на все». Рутинний agent loop → Terra/Luna; важкі рефактори/довгі задачі → Sol.

Сама GPT-5.6 Sol вже відчувається як GPT-6 й може годинами автономно з самоперевіркою виконувати завдання чи генерувати код. Саме через це реліз спочатку різали під урядовий preview й тільки потім зробили відкритим для всіх.

Новий Work / Codex app
https://openai.com/index/chatgpt-for-your-most-ambitious-work/
OpenAI інтегрує свій Codex app з Atlas браузером (через декілька днів Anthropic теж інтегрувала браузер у свій Cluade work/code) та новим ChatGPT під Mac/Windows. Тепер три режими: Chat (швидкі питання/чернетки), Work (довгі агентні задачі з документами/поштою), окремо Codex (підключення репозиторіїв).

Кажуть Computer Use став ще краще. Всюди працюють плагіни, скіли, завдання за розкладом, ітд. Задачі можна менеджити з телефону. Додали вкладку Sites (Сайти) де можна розмістити публічні dashboards/прототипи без зайвих зусиль, просто давши у чаті команду опублікувати сайт.

Додали Inline-редагування. Тепер код і текст можна змінювати прямо в інтерфейсі ChatGPT, не перемикаючись щоразу в зовнішній редактор заради невеликих виправлень.

Клавіатура Codex Micro
https://worklouder.cc/codex-micro
OpenAI також представила свій перший апаратний продукт: компактну програмовану клавіатуру (точніше, макропад), створену спільно з Work Louder для роботи з агентами Codex. Вона має спеціальні клавіші для керування агентами, індикатори їхнього статусу, регулятор рівня reasoning та підтримку голосових команд.

Нарешті відповідь на Claude Code і Codex від команди Елона Маска.

Grok 4.5 — швидше й дешевше за Opus-клас
https://x.ai/news/grok-4-5
https://cursor.com/blog/grok-4-5
8 липня 2026 SpaceXAI презентувала модель Grok 4.5 — зроблена під генерацію коду, автономну роботу з інструментами й «офісні» задачі. Тренували разом із Cursor на десятках тисяч GPU. У даних — трильйони токенів реальних Cursor-сесій: як люди працюють з репозиторіями, агентами й інструментами, плюс STEM і знання, не лише «чистий» кодинг як у Composer 2.5. Модель бачила як реально виглядає робота в Cursor людей, які у налаштування дозволили це.

У бенчмарках модель не перша скрізь — між GPT 5.5 (а 5.6 вже не за горами) і Opus/Fable — ставка саме на розумність за свою вартість. В порівняні з GLM-5.2 у Grok є можливість приймати на вхід зображення.

На SWE Bench Pro модель витрачає приблизно в 4 рази менше вихідних токенів, ніж Opus 4.8 на максимальних налаштуваннях, і видає близько 80 токенів на секунду. На довгих задачах Grok менше ускладнює відповіді, ніж Sonnet 5 чи Opus, і через це реальний рахунок часто виходить вигіднішим, ніж підказує порівняння цін за токен. API коштує $2/$6 за млн вхідних/вихідних токенів; якщо контекст перевищує 200k (максимум 500k) — ціна подвоюється.

Grok Build CLI для всіх
https://x.ai/cli
https://x.ai/news/grok-build-cli
Тепер дефолтом встановили Grok 4.5 з вікном 500k. Grok Build — terminal-native coding agent (CLI на Rust, з травня 2026 у beta). Це не чат у браузері, а агент у командному рядку. Є все що потрібно - паралельні subagents (у т.ч. у окремих git worktree), skills / plugins / hooks / MCP / AGENTS.md. На старті свідомо підхоплює налаштування з Claude Code (skills з ~/.claude/, частина permissions). Є headless (grok -p) для скриптів і CI, voice, image/video tools, /goal для довгих цілей.

Grok Build робить ставку на швидкість та паралельність (кілька агентів одночасно). Зараз в нього гарний чистий terminal UX, сумісність зі форкфлоу з Claude-екосистеми. Плюс на обмежений час безкоштовний ліміт у Grok Build і Cursor (у Cursor — на всіх планах, перший тиждень з double usage). В ЄС 4.5 поки немає (обіцяють середину липня).

Зараз в інтерфейсі багато нагадувань "заплати за підписку". За замовчуванням після встановлення збір даних для тренування включений - треба заходити в налаштування та відмовлятися. В моєму порівняльному тестуванні ZCode (теж порівняно недорога GLM-5.2) vs Grok Build мені більше сподобалися результати від Grok.

https://www.youtube.com/watch?v=RGXRUH3oK6U

На думку автора відео Grok створив гарнішу версію (краща кольорова палітра, зручніший дизайн) презентації. Grok створив набагато кращий результат симуляція Сонячної системи. Для створення веб-сторінки з фото результати приблизно однакові. Головна перевага — ціна, вона в 5–6 разів дешевше за Claude Code.

Обговорення
https://news.ycombinator.com/item?id=48835111
На HN дискусія крутиться навколо ціни, швидкості й того, скільки токенів реально з’їдає задача. Перші відгуки: дуже швидка, рівень близько нижньої частини Opus / GLM 5.2, і якщо платити за API — часто дешевше за GPT і Opus. Інтерфейс Grok Build хвалять — «зроблено добре», особливо на тлі все більшого погіршення Claude Code.

Скепсис теж є. Перестає виглядати дешево, коли контекст >200k; хтось лишає лише для коротких review. Є скарги, що на простих правках (inline helpers) модель переписує пів модуля замість десяти рядків. Репутація Grok (старі скандали з safety) досі згадують як причину не використовувати модель.

Дані Cursor і тренування на важких середовищах — сильна сторона; Grok 4.5 + Grok Build виглядають як гарний кандидат спробувати на різних свої завдання якщо репозиторії не великі.

Останні пів року більшість нових великих мовних моделей вже не просто можуть відповідати на питання якісно, а й мають здатніть для довгої самостійної роботи.

Loop Engineering (інженерія циклів) - спосіб будувати роботу з агентами так, щоб агент не просто відповідав на один запит, а багато разів проходив цикл: зрозуміти завдання, зібрати контекст, зробити малу дію, перевірити результат, виправити помилку і зупинитися за явним правилом.

Промпт-інженерія намагається покращити одну відповідь моделі. Інженерія циклів намагається покращити весь процес доведення роботи до перевіреного результату.

Що таке інженерія циклів
https://kilo.ai/articles/what-is-loop-engineering
Цей матеріал дає основу. Сила не в одному кроці, а в замиканні циклу коли будь-яка помилка тесту, помилка коду - це не просто невдача, а новий контекст. Але добрий розроблений цикл не повинен працювати безмежно, потрібно явно задавати ціль, контекст, перевірку і правила зупинки. Також розглядаються ризики такої небезпечної автономності.

Базовий цикл виглядає так:

  1. Намір. Людина або система задає конкретний результат.
  2. Контекст. Агент читає код, документацію, помилки, журнали, вимоги, правила проєкту.
  3. Дія. Агент змінює код, запускає команду, викликає інструмент або готує план.
  4. Спостереження. Система отримує тести, помилки компілятора, результат збірки, журнал, скриншот, коментар рев'ю.
  5. Корекція. Агент змінює план і повторює цикл.
  6. Зупинка. Цикл завершується, коли є доказ виконання, або коли з'явився блокер.

Звідки популярність терміну
https://addyosmani.com/blog/loop-engineering/
Addy Osmani посилається на думки Peter Steinberger і Boris Cherny та популяризував формулювання. Замість того щоб самому кожного разу підказувати агенту наступний крок, ми будуємо систему, яка підказує агенту за нас. Вчимося проєктувати контур перевірки, пам'яті, доступів і закінчення роботи.

Під-агенти розділяють того, хто робить, і того, хто перевіряє; Автоматизації запускають роботу за розкладом, окремі робочі дерева ізолюють паралельних агентів, плагіни і підключення дають доступ до реальних інструментів. Знання про проєкт зберігаються окремо - що зроблено, що лишилось, що вже пробували.

https://lushbinary.com/blog/loop-engineering-ai-coding-agents-guide/
Lushbinary багато в чому переказує Addy, але додає практичніші деталі: цикл Ralph, як виглядають автоматизації, окремі робочі дерева, навички, підключення, під-агенти і пам'ять у сучасних інструментах.

Якщо в циклі немає запобіжника, бюджету, журналів, стійкої пам'яті, ізоляції і ручного виходу з помилки, то це не продукційна система, а просто нескінченний цикл із дорогим агентом усередині.

Чотири рівні циклів
https://www.langchain.com/blog/the-art-of-loop-engineering
LangChain намагається нам продати свій стек та прямо визнає компроміс: перевірки збільшують вартість і затримку, але для якості потрібні. Вони пропронують розгядати чотири цикла:

  1. Цикл агента. Модель викликає інструменти, доки задача не завершена.
  2. Цикл перевірки. Окремий агент-оцінювач перевіряє результат за правилами і повертає агенту-виконавцю зворотний зв'язок.
  3. Цикл подій. Запуск відбувається не вручну, а через події: розклад, зовнішній сигнал, повідомлення, новий документ.
  4. Цикл покращення. Логи запусків аналізуються, щоб покращити налаштування, інструменти або промпти.

Відео Matthew Berman
https://www.youtube.com/watch?v=dMrm2jAyrKM

Відео "Only the best are using them..." подає тему як нову "мету" для кодування. Там є сильний хайповий тон: "майбутнє програмної інженерії", "лише небагато людей знають, як це робити", "найкращі вже використовують". Воно добре пояснює ідею для широкої аудиторії, але найбільше підсилює хайп.

Критика терміна
https://iii.dev/blog/loop-engineering-is-just-software-engineering/
У багатьох текстах "Loop Engineering" звучить так, ніби з'явилась нова парадигма. Частина авторів подає це як майбутнє всієї розробки, хоча багато складників давно відомі як нормальна інженерія: тести, черги, планувальники, журналювання, контроль доступів, повторні спроби, перевірка людиною.

Переклад термінів:

  • автоматизації за розкладом - планувальник;
  • пам'ять поза розмовою - сховище стану;
  • перевірник - окремий споживач результату з логікою повтору;
  • застряглі задачі - черга помилок;
  • підключення до зовнішніх сервісів - зовнішні сигнали та інтеграції.

Найкраще це працює для механічної, повторюваної і добре перевірюваної роботи, де завдання можна розбити на чіткі кроки з перевіркою. Для продуктових рішень, архітектури, безпеки, фінансових дій, змін у базі даних і всього, де потрібне судження, людина має залишатися у контурі прийняття рішення.

Cursor провів Compile 26 — свій день "розробника" про майбутнє програмування.

https://www.marketwatch.com/story/social-media-declared-cursor-dead-then-spacex-handed-the-ai-startup-a-60-billion-lifeline-50454e29
Michael Truell на Compile показував новий Composer — вже власну модель на 1.5T параметрів, яку Cursor тренував з нуля на більш ніж 100k Nvidia GPU від SpaceX/xAI. На його думку Cursor більше не просто "кращий VS Code з чатиком", а платформа для агентного програмування.

Можливо модель буде доступна й в Grok Build.

https://www.youtube.com/watch?v=fWa7uxyhVDE

https://www.youtube.com/@cursor_ai/videos
На офіційному YouTube-каналі потрохи викладають записи виступів. Короткі доповіді по 10-25 хвилин, багато розмов не про "AI замінить програмістів", а про те, як змінюється сама робота: пам'ять агентів, інфраструктура для паралельних агентів, роль PM, роль senior engineer, навчання, контроль якості.

Окрім роботи з агентами та їх пам'яттю є ще виступи про нотатки, представлення думок і робочі середовища, про агентність у мові, про ефективність інтелекту, про те, як зміщується робота інженера та інші не технічні теми.

Origin — GitHub для агентів
https://cursor.com/origin
Окремо найцікавіший анонс це Origin, нова Git-платформа від Cursor. На сайті вони називають її гіт для агентів. У виступі Origin прямо представили як agent-native Git platform, а в кінці підсумували це як початок конкуренції з GitHub.

Агенти тут можуть працювати з репозиторієм, створювати й обробляти PR, відповідати на коментарі, фіксити CI failures, розв'язувати merge conflicts і тегати людину тільки коли справді треба.

Зараз Origin вже працює для внутрішнього використання, а для всіх інших відкритий waitlist.

Схоже, Китай все активніше йде не тільки в моделі, а й у повні coding harness / agent app.

Kimi K2.7 і у Github Copilot
https://github.blog/changelog/2026-07-01-kimi-k2-7-is-now-available-in-github-copilot/
GitHub додав Kimi K2.7 Code у Copilot. Це перша open-weight модель, яку можна обрати у Copilot. Хоститься на Microsoft Azure.

MiMo-Code CLI від Xiaomi
https://mimo.xiaomi.com/mimocode
https://mimo.xiaomi.com/blog/mimo-code-long-horizon
https://github.com/XiaomiMiMo/MiMo-Code
Xiaomi розробляє свій open-source CLI MiMoCode. Вміє працювати з Git, checkpoint-и, task tree, subagents, compose mode, voice input. Має persistent memory на SQLite FTS5 та команди, /dream і /distill для витягування знань та повторюваних workflow у skills.

Цікаво, що це не просто "ще один CLI", а спроба зробити Codex/Claude Code-подібний агент із власною пам'яттю й режимами роботи. Є безкоштовний на старті MiMo Auto, OAuth через Xiaomi MiMo Platform, підтримка OpenAI-сумісних провайдерів.

ZCode застосунок v3 від Z.ai
https://zcode.z.ai/en
ZCode — desktop застосунок на MacOS/Windows/Linux під топову модель GLM-5.2, Z.ai з v3 оптимізує цілий agent harness саме під свою модель та тарифні плани. Виглядає як пряма копія Codex app.

Має керування плагінами, відкат файлів (file rewind) із безпековим саммарі (safety summary), покращені пропозиції команд для промптів, планування, рев'ю, деплой, завдання робочого простору (workspace tasks), навички (skills) та мультиагентну взаємодію. Можна керувати агентом через чат у WeChat, Feishu чи Telegram.

Обговорення
https://news.ycombinator.com/item?id=48753715
На HN головний нерв — довіра. ZCode не є open-source, на відміну від MiMoCode, тому люди питають про telemetry, sandboxing і чи запускати desktop agent на основній машині взагалі безпечно. Багато коментарів зводяться до практики: агентів краще запускати у VM/containers, давати їм окремі worktree, окремі GitHub deploy keys і мінімальний доступ до секретів.

Sonnet 5 - довше й дорожче
https://www.anthropic.com/news/claude-sonnet-5
Anthropic випустила Claude Sonnet 5. Позиціонування: найагентніший Sonnet, ближчий до Opus 4.8, але дешевший. Доступний у Claude, Claude Code і API як claude-sonnet-5. До 31 серпня 2026 ціна знижена до $2/$10 за млн input/output токенів, потім буде $3/$15. Opus 4.8 для порівняння — $5/$25.

Додатковий нюанс: новий tokenizer може рахувати той самий текст як 1.0-1.35x більше токенів залежно від контенту. Тобто "дешевший Sonnet" не завжди автоматично дешевший у реальному рахунку. Модель не така розумна, але показує кращі результати бо наполегливіша. Тому й токенів може дуже багато витрачати.

Обговорення
https://news.ycombinator.com/item?id=48736605
HN зустрів Sonnet 5 скептично. Багато хто питає, навіщо брати Sonnet 5 на high effort, якщо Opus 4.8 low/medium іноді дає кращий результат за долар. Інша претензія — моделі стають більш "агентними", але іноді переускладнюють прості задачі й самі генерують зайву роботу.

Новини від OpenAI.

GPT-5.5-Cyber і ініціатива Daybreak
https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
Анонсували реліз моделі GPT-5.5-Cyber у рамках ініціативи Daybreak. Модель заточена під захисну безпеку: пошук вразливостей, threat modeling, генерація патчів для кодових баз. На бенчмарку CyberGym вона набрала 85.6% — більше за базовий GPT-5.5 (81.8%) і Anthropic Mythos 5 (83.8%). Наразі доступ — лише для верифікованих організацій.

Codex: скидання rate-limit
https://community.openai.com/t/flexible-rate-limit-resets-for-codex-and-a-method-to-get-a-reset/1383470
Головна зміна червня 2026 — banked rate-limit resets. Механізм: якщо протягом 5-годинного вікна не вибрати увесь ліміт — залишок «банкується» і зберігається як окремий reset, який можна використати пізніше. Це не API-кредити і не гроші на балансі — виключно додатковий ліміт у межах підписки ChatGPT. Він діє 30 днів від моменту нарахування.

Кожен користувач Plus/Pro отримав один безкоштовний reset, ще до трьох можна заробити рефералами до 24 червня. У деяких не з'являлися до першого рефералу. Активувати банкований reset можна через Codex desktop app у розділі Settings → Usage remaining. Є нюанс: (деякі Linux і) CLI-користувачі та VSCode-плагін-користувачі поки не мають нативного способу це зробити — тільки десктопний застосунок. У спільноті вже з'явились неофіційні скрипти для CLI-обходу.

Також з'явився екран Codex Profile — там видно usage stats і графіки активності токенів, що особливо корисно з переходом на токенний білінг.

Codex-Maxxing — гайд для довгих сесій
https://openai.com/index/codex-maxxing-long-running-work/
OpenAI опублікувала PDF офіційний гайд / white paper Codex-Maxxing. Це методичка про те, як можна використовувати Codex як постійного робочого агента, який веде довготривалі проєкти, а не просто відповідає на окремі запити. OpenAI бачить майбутнє не в тому, щоб кожного разу починати новий чат.

Термін "Codex-maxxing" тут використовується як назва підходу: не просто задавати питання Codex, а будувати навколо систему роботи:

  • Codex може й має працювати не тільки з кодом. Може керувати як комп'ютером, так і тільки браузером чи мати MCP доступ до пошти/календаря/ітд.
  • замість окремих чатів — постійні потоки роботи (Durable Threads) із накопиченою історією проекту і стиснення контексту (compaction.
  • пам'ять агента повинна бути видимою й відокремленою. Репозиторії зберігають код. Vault (окрема папка) зберігає контекст, рішення, відкрити цикли, поточний стан роботи, тощо.
  • steering — керування під час роботи. Ми не кидаємо завданнях і чекаємо щоб оцінити результат, тепер дивимося що відбувається й в реальному часі дорозповідаємо агенту правки. Взаємодія нагадує роботу з живим співробітником. Дивимося не в чат, а на саму роботу (документи, код) й коментуємо конкретно що де треба по іншому.
  • голос краще за текст + доступ з телефону. OpenAI вважає, що люди текстом часто вводять занадто "відредаговані" запити, а голос дозволяє передати емоції, сирі ідеї, уривки думок які сучасні моделі вже можуть брати до роботи. Ідеш гуляти та розмовляти з агентом з телефону, поки він працює за комп'ютером.
  • використовувати Heartbeats, вони ж Thread Automation — заплановані автоматичні перевірки які дозволяють агенту моніторити стан репозиторію або CI-пайплайну без участі людини. Агент не чекає нового повідомлення від користувача, а сам повертається до задачі за розкладом.

Задачі формулюються через чіткі верифіковані критерії виходу — наприклад, «покрити 100% тестами» або «скоротити час деплою на 30%» — і агент працює автономно до їх досягнення з перевірками. Погана сформульована задача це "Реалізуй весь план", добра це "Перенеси бібліотеку на Rust, збережи API сумісним і вважай задачу завершеною лише тоді, коли всі старі тести проходять успішно."

Китайські ШІ сервіси продовжують потрохи наздоганяти США варіанти.

TRAE Solo тепер Work
https://solo.trae.cn/
https://docs.trae.ai/solo/what-is-trae-solo?_lang=en
ByteDance перейменувала свій інструмент «Trae Solo» на Trae Work, підкреслюючи зміну позиціонування: від простого асистента розробника до повноцінного автономного «ШІ-співробітника» для виконання різних завдань (збір даних, створення контенту, веб дослідження, тощо). Code залишається як окрема вкладка, є конектор до GitHub. За інтерфейсом схоже на Codex app, наявні Skills та MCP з каталогом. Інструмент доступний у вебі, на десктопі та на мобільному телефоні. За замовчуванням для нових аккаунтів "Privacy Mode" вимкнений, тому треба самому його активувати.

Розумна GLM-5.2
https://docs.z.ai/guides/llm/glm-5.2
https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index
Zhipu AI випустила GLM-5.2 — Mixture-of-Experts (MoE) модель на 753B параметрів під ліцензією MIT, що значно покращує показники GLM-5.1. Контекстне вікно розширили до 1M токенів (проти 200k у попередника).

https://www.youtube.com/watch?v=nODxez6nZEU

Модель посіла перше місце серед open-source моделей у рейтингу Artificial Analysis Intelligence Index (v4.1) з оцінкою 51, демонструючи кодинг-навички на рівні пропрієтарної Claude Opus 4.8. В цілому вона більше заплутуєтся й споживає більше токенів, але видає результати.

Обговорення
https://news.ycombinator.com/item?id=48567759
На Hacker News модель хвалять за співвідношення ціни та можливостей на довгих циклах розробки. Водночас користувачі зазначають, що режим міркувань «Max» є вкрай повільним та витрачає багато токенів. Через великий розмір (753B) локальний запуск на звичайних MacBook Pro неможливий, але можливо купувати GPU-хмару чи через https://openrouter.ai/z-ai/glm-5.2#providers.

На сьогодні рейтингу ТОП моделей для програмування на OpenRouter за обсягом використання (кількістю токенів):

  1. MiMo-V2.5 (від xiaomi) — впевнений лідер рейтингу з обсягом 4.59T (трильйонів) токенів, що становить 22.5% від загальної частки ринку.
  2. MiniMax M3 (від minimax) — посідає друге місце з показником 2.45T токенів (12.0%).
  3. Hy3 preview (від tencent) — третє місце з обсягом 1.43T токенів (7.0%).
  4. Claude Opus 4.7 (від anthropic) — четверте місце, на яке припадає 1.17T токенів (5.7%).
  5. DeepSeek V4 Pro (від deepseek) — замикає першу п'ятірку з обсягом 1.14T токенів (5.6%).
  6. DeepSeek V4 Flash (від deepseek) — шосте місце з показником 972B (мільярдів) токенів (4.8%).
  7. GLM 5.1 (від z-ai) — сьоме місце з 952B токенів (4.7%).
  8. GLM 5.2 (від z-ai) — восьме місце з 820B токенів (4.0%).

GLM-5.2 у OpenCode
https://dev.to/danielbergholz/testing-glm-52-on-opencode-im-impressed-1780
Автор статті Даніель Бергхольц протестував її в реальних умовах розробки, інтегрувавши GLM-5.2 через OpenRouter у безкоштовний кодинг-агент OpenCode.

У практичному тесті на реальному проєкті Next.js модель мала розробити функціонал фільтрації статей із дебаунсом у 300 мс без засмічення історії браузера. GLM-5.2 показала себе як дещо повільна, але вдумлива модель: у режимі планування вона без додаткових підказок проаналізувала архітектуру проєкту, зрозуміла різницю між серверними й клієнтськими компонентами та логічно пояснила вибір саме клієнтського рендерингу для цього завдання. Вона з першої спроби («one-shot») написала чистий, робочий код і виявила рідкісну для ШІ-помічників «стриманість», не намагаючись ускладнити наявну структуру проєкту.

Весь сеанс роботи, що включав дослідження репозиторію, планування, написання коду, рев'ю та фінальне виправлення, коштував автору лише $0,265 (менше 27 центів).