CodeWithLLM-Updates
-
🤖 Інструменти ШІ для програмування: практичні приклади, покрокові інструкції та реальні застосування LLM. Навчіться ефективно працювати з сучасними асистентами програмування.

Grok скандал із «тихим» вивантаженням коду, потім — відкритий код як спроба повернути довіру.

Grok CLI та стеження
https://www.internationalcyberdigest.com/xais-grok-build-cli-uploads-entire-git-repositories-to-a-google-cloud-bucket/
https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547
Відразу кілька людей написали репорти, що Grok Build CLI при старті сесії детерміновано (не «агент сам вирішив») пакує поточну директорію / git-репозиторій і заливає його в інтернет на Google Cloud Storage (grok-code-session-traces). Один користувач запустив grok з home directory і побачив, що пішли SSH-ключі, password manager, документи, фото — всі його файли.

Люди почали досліджувати. Це НЕ поведінка моделі. Налаштування приватності «Improve the model» / /privacy тільки керує чи будуть данні використані для навчання, а не тим, чи файли взагалі будуть скопійовані з машини. Це робить код harness'а, аналіз (cereblab, grok 0.2.93) показав два канали:

  1. Model turn (/v1/responses) — те, що агент реально прочитав (у т.ч. .env).
  2. Знімок всієї папки — окреме завантаження усього репозиторія включаючи git history, навіть файлів, які агенту сказали НЕ читати.

На 12 GB репо пішло ≈5.1 GiB у Google Cloud Storage при ≈192 KB на модель. Як вихід був локальний kill-switch: [harness] disable_codebase_upload = true у ≈/.grok/config.toml (+ env для telemetry). Але сервери xAI після розголосу цієї поведінки десь з 12 липня самі вимкнули завантаження. Маск пообіцяв повністю видалити раніше завантажені дані.

https://news.ycombinator.com/item?id=48892468
На HN тон жорсткий: не повинно «trust this directory» давати право «upload everything to vendor». Тому люди все еще за те, щоб агентів тримати у VM/container/окремому user й не допускати до свої машини.

Порівнюють з Cursor indexing (вони теж завантажували при старті всі файли), але там це було прописано в документації відкрито як необхідність більше швидкого створення embeddings.

Grok CLI відкрили код
https://x.ai/open-source
https://github.com/xai-org/grok-build
https://simonwillison.net/2026/Jul/15/grok-build/
Після скандалу SpaceXAI/xAI виклали код Grok Build на GitHub під Apache 2.0: Rust TUI + agent runtime (≈845k SLOC, ≈3% vendored). Репо — періодичний snapshot з внутрішнього monorepo (SOURCE_REV), зовнішні PR/issues не приймають. Можна збирати з source і ганяти local-first з власним inference. На практиці бінарники з CDN і open tree — різні речі, поки немає reproducible builds.

У коді лишилися сліди upload path (upload/gcs.rs), але session upload повертає session_state_upload_unavailable. Є порти tools з Codex/OpenCode (з THIRD-PARTY notices), terminal Mermaid renderer, system/subagent prompts.

Обговорення
https://news.ycombinator.com/item?id=48926590
На HN змішано: бачать стратегія відстаючого гравця та «відкрили, бо спіймали на непрозорій поведінці». Хвалять TUI (миша, smoothness). Спільнота вже ріже privacy-форки:

  • gork-build https://github.com/thedavidweng/gork-build (telemetry strip, block auto-update),
  • digi-grok / open-grok (multi-provider),
  • desktop Tauri-обгортки,
  • скрипти вимкнення telemetry.
    Але багато хто вважає, що все одно форки не мають змісту для інших моделей, бо під них вже краще взяти Pi / OpenCode.

Нарешті анонси моделей які роблять суттєвий крок уперед.

Величезна Kimi K3
https://www.kimi.com/blog/kimi-k3
Moonshot випустила Kimi K3 — open frontier дуже велику модель на 2.8T параметрів (MoE: активує 16 з 896 experts), з 1M контекстом і нативним розумінням зображень. Це перша open-модель класу ~3T. Налаштована для довгої агентної роботи, в презентації роблять акцент на генерацію простих 3д ігор.

Також у кейсах — оптимізація GPU-ядер, збірка MiniTriton-компілятора з нуля, 48-годинний прогін chip design. За їхніми бенчмарками вона трохи поступається Claude Fable 5 і GPT-5.6 Sol, але стабільно обходить Opus 4.8, GPT-5.5 і точно GLM-5.2. Тобто на зараз це трете місце у світі, K3 відстає від Fable 5 лише приблизно на 5%. За доброю китайскою традицією дешевша за США конкурентів.

На момент анонсу виклали не самі ваги моделі, а лише доступ через API, Kimi.com, Kimi Code та інші свої сервіси. У технічному блозі Moonshot пише, що повні ваги моделі будуть опубліковані до 27 липня 2026 року.

Обговорення
https://news.ycombinator.com/item?id=48935342
За Simon Willison це «найдорожчий пелікан» серед китайських моделей. Якщо K3 справді близько до Fable/Sol — то така ціна виправдана. Локально 2.8T майже нікому не підняти тому тут цінність у GPU клауді, а не в «на ноуті». В цілому довга суперечка про те, чи китайські лабораторії вже майже наздогнали Anthropic/OpenAI, чи ще суттєво відстають.

https://www.youtube.com/watch?v=QfCpRTLSOB4

Fable 5 повернули
https://www.anthropic.com/news/redeploying-fable-5
Після релізу 9 червня керівництво США наклала заборону на відкритий доступ до найпотужніших на сьогодні Anthropic моделей Fable 5 / Mythos 5 з необхідністю попередньої внутрішньої перевірки загроз безпеки. Anthropic вимкнула доступ усім, бо не могла перевіряти звідки користувач.

30 червня обмеження зняли; з 1 липня Fable 5 знову глобально в Claude, Claude Code, Cowork і Platform. Mythos 5 — лише для обмеженого кола США-організацій (Glasswing). Anthropic також продовжила пільговий період доступу до Fable 5 в межах підписних планів спочатку до 12 липня, а потім до 19 липня. Чи буде надалі доступ до моделі тільки за оплату токенів подивимося вже незабаром.

GPT-5.6 у трьох варіантах
https://openai.com/index/gpt-5-6/
OpenAI вивела сімейство GPT-5.6: Sol (передова), Terra (баланс, ~рівень GPT-5.5 при нижчій ціні), Luna (швидка/дешева, ~рівень GPT-5.4). Добре що з'явився явний вибір замість «одна модель на все». Рутинний agent loop → Terra/Luna; важкі рефактори/довгі задачі → Sol.

Сама GPT-5.6 Sol вже відчувається як GPT-6 й може годинами автономно з самоперевіркою виконувати завдання чи генерувати код. Саме через це реліз спочатку різали під урядовий preview й тільки потім зробили відкритим для всіх.

Новий Work / Codex app
https://openai.com/index/chatgpt-for-your-most-ambitious-work/
OpenAI інтегрує свій Codex app з Atlas браузером (через декілька днів Anthropic теж інтегрувала браузер у свій Cluade work/code) та новим ChatGPT під Mac/Windows. Тепер три режими: Chat (швидкі питання/чернетки), Work (довгі агентні задачі з документами/поштою), окремо Codex (підключення репозиторіїв).

Кажуть Computer Use став ще краще. Всюди працюють плагіни, скіли, завдання за розкладом, ітд. Задачі можна менеджити з телефону. Додали вкладку Sites (Сайти) де можна розмістити публічні dashboards/прототипи без зайвих зусиль, просто давши у чаті команду опублікувати сайт.

Додали Inline-редагування. Тепер код і текст можна змінювати прямо в інтерфейсі ChatGPT, не перемикаючись щоразу в зовнішній редактор заради невеликих виправлень.

Клавіатура Codex Micro
https://worklouder.cc/codex-micro
OpenAI також представила свій перший апаратний продукт: компактну програмовану клавіатуру (точніше, макропад), створену спільно з Work Louder для роботи з агентами Codex. Вона має спеціальні клавіші для керування агентами, індикатори їхнього статусу, регулятор рівня reasoning та підтримку голосових команд.

Нарешті відповідь на Claude Code і Codex від команди Елона Маска.

Grok 4.5 — швидше й дешевше за Opus-клас
https://x.ai/news/grok-4-5
https://cursor.com/blog/grok-4-5
8 липня 2026 SpaceXAI презентувала модель Grok 4.5 — зроблена під генерацію коду, автономну роботу з інструментами й «офісні» задачі. Тренували разом із Cursor на десятках тисяч GPU. У даних — трильйони токенів реальних Cursor-сесій: як люди працюють з репозиторіями, агентами й інструментами, плюс STEM і знання, не лише «чистий» кодинг як у Composer 2.5. Модель бачила як реально виглядає робота в Cursor людей, які у налаштування дозволили це.

У бенчмарках модель не перша скрізь — між GPT 5.5 (а 5.6 вже не за горами) і Opus/Fable — ставка саме на розумність за свою вартість. В порівняні з GLM-5.2 у Grok є можливість приймати на вхід зображення.

На SWE Bench Pro модель витрачає приблизно в 4 рази менше вихідних токенів, ніж Opus 4.8 на максимальних налаштуваннях, і видає близько 80 токенів на секунду. На довгих задачах Grok менше ускладнює відповіді, ніж Sonnet 5 чи Opus, і через це реальний рахунок часто виходить вигіднішим, ніж підказує порівняння цін за токен. API коштує $2/$6 за млн вхідних/вихідних токенів; якщо контекст перевищує 200k (максимум 500k) — ціна подвоюється.

Grok Build CLI для всіх
https://x.ai/cli
https://x.ai/news/grok-build-cli
Тепер дефолтом встановили Grok 4.5 з вікном 500k. Grok Build — terminal-native coding agent (CLI на Rust, з травня 2026 у beta). Це не чат у браузері, а агент у командному рядку. Є все що потрібно - паралельні subagents (у т.ч. у окремих git worktree), skills / plugins / hooks / MCP / AGENTS.md. На старті свідомо підхоплює налаштування з Claude Code (skills з ~/.claude/, частина permissions). Є headless (grok -p) для скриптів і CI, voice, image/video tools, /goal для довгих цілей.

Grok Build робить ставку на швидкість та паралельність (кілька агентів одночасно). Зараз в нього гарний чистий terminal UX, сумісність зі форкфлоу з Claude-екосистеми. Плюс на обмежений час безкоштовний ліміт у Grok Build і Cursor (у Cursor — на всіх планах, перший тиждень з double usage). В ЄС 4.5 поки немає (обіцяють середину липня).

Зараз в інтерфейсі багато нагадувань "заплати за підписку". За замовчуванням після встановлення збір даних для тренування включений - треба заходити в налаштування та відмовлятися. В моєму порівняльному тестуванні ZCode (теж порівняно недорога GLM-5.2) vs Grok Build мені більше сподобалися результати від Grok.

https://www.youtube.com/watch?v=RGXRUH3oK6U

На думку автора відео Grok створив гарнішу версію (краща кольорова палітра, зручніший дизайн) презентації. Grok створив набагато кращий результат симуляція Сонячної системи. Для створення веб-сторінки з фото результати приблизно однакові. Головна перевага — ціна, вона в 5–6 разів дешевше за Claude Code.

Обговорення
https://news.ycombinator.com/item?id=48835111
На HN дискусія крутиться навколо ціни, швидкості й того, скільки токенів реально з’їдає задача. Перші відгуки: дуже швидка, рівень близько нижньої частини Opus / GLM 5.2, і якщо платити за API — часто дешевше за GPT і Opus. Інтерфейс Grok Build хвалять — «зроблено добре», особливо на тлі все більшого погіршення Claude Code.

Скепсис теж є. Перестає виглядати дешево, коли контекст >200k; хтось лишає лише для коротких review. Є скарги, що на простих правках (inline helpers) модель переписує пів модуля замість десяти рядків. Репутація Grok (старі скандали з safety) досі згадують як причину не використовувати модель.

Дані Cursor і тренування на важких середовищах — сильна сторона; Grok 4.5 + Grok Build виглядають як гарний кандидат спробувати на різних свої завдання якщо репозиторії не великі.

Останні пів року більшість нових великих мовних моделей вже не просто можуть відповідати на питання якісно, а й мають здатніть для довгої самостійної роботи.

Loop Engineering (інженерія циклів) - спосіб будувати роботу з агентами так, щоб агент не просто відповідав на один запит, а багато разів проходив цикл: зрозуміти завдання, зібрати контекст, зробити малу дію, перевірити результат, виправити помилку і зупинитися за явним правилом.

Промпт-інженерія намагається покращити одну відповідь моделі. Інженерія циклів намагається покращити весь процес доведення роботи до перевіреного результату.

Що таке інженерія циклів
https://kilo.ai/articles/what-is-loop-engineering
Цей матеріал дає основу. Сила не в одному кроці, а в замиканні циклу коли будь-яка помилка тесту, помилка коду - це не просто невдача, а новий контекст. Але добрий розроблений цикл не повинен працювати безмежно, потрібно явно задавати ціль, контекст, перевірку і правила зупинки. Також розглядаються ризики такої небезпечної автономності.

Базовий цикл виглядає так:

  1. Намір. Людина або система задає конкретний результат.
  2. Контекст. Агент читає код, документацію, помилки, журнали, вимоги, правила проєкту.
  3. Дія. Агент змінює код, запускає команду, викликає інструмент або готує план.
  4. Спостереження. Система отримує тести, помилки компілятора, результат збірки, журнал, скриншот, коментар рев'ю.
  5. Корекція. Агент змінює план і повторює цикл.
  6. Зупинка. Цикл завершується, коли є доказ виконання, або коли з'явився блокер.

Звідки популярність терміну
https://addyosmani.com/blog/loop-engineering/
Addy Osmani посилається на думки Peter Steinberger і Boris Cherny та популяризував формулювання. Замість того щоб самому кожного разу підказувати агенту наступний крок, ми будуємо систему, яка підказує агенту за нас. Вчимося проєктувати контур перевірки, пам'яті, доступів і закінчення роботи.

Під-агенти розділяють того, хто робить, і того, хто перевіряє; Автоматизації запускають роботу за розкладом, окремі робочі дерева ізолюють паралельних агентів, плагіни і підключення дають доступ до реальних інструментів. Знання про проєкт зберігаються окремо - що зроблено, що лишилось, що вже пробували.

https://lushbinary.com/blog/loop-engineering-ai-coding-agents-guide/
Lushbinary багато в чому переказує Addy, але додає практичніші деталі: цикл Ralph, як виглядають автоматизації, окремі робочі дерева, навички, підключення, під-агенти і пам'ять у сучасних інструментах.

Якщо в циклі немає запобіжника, бюджету, журналів, стійкої пам'яті, ізоляції і ручного виходу з помилки, то це не продукційна система, а просто нескінченний цикл із дорогим агентом усередині.

Чотири рівні циклів
https://www.langchain.com/blog/the-art-of-loop-engineering
LangChain намагається нам продати свій стек та прямо визнає компроміс: перевірки збільшують вартість і затримку, але для якості потрібні. Вони пропронують розгядати чотири цикла:

  1. Цикл агента. Модель викликає інструменти, доки задача не завершена.
  2. Цикл перевірки. Окремий агент-оцінювач перевіряє результат за правилами і повертає агенту-виконавцю зворотний зв'язок.
  3. Цикл подій. Запуск відбувається не вручну, а через події: розклад, зовнішній сигнал, повідомлення, новий документ.
  4. Цикл покращення. Логи запусків аналізуються, щоб покращити налаштування, інструменти або промпти.

Відео Matthew Berman
https://www.youtube.com/watch?v=dMrm2jAyrKM

Відео "Only the best are using them..." подає тему як нову "мету" для кодування. Там є сильний хайповий тон: "майбутнє програмної інженерії", "лише небагато людей знають, як це робити", "найкращі вже використовують". Воно добре пояснює ідею для широкої аудиторії, але найбільше підсилює хайп.

Критика терміна
https://iii.dev/blog/loop-engineering-is-just-software-engineering/
У багатьох текстах "Loop Engineering" звучить так, ніби з'явилась нова парадигма. Частина авторів подає це як майбутнє всієї розробки, хоча багато складників давно відомі як нормальна інженерія: тести, черги, планувальники, журналювання, контроль доступів, повторні спроби, перевірка людиною.

Переклад термінів:

  • автоматизації за розкладом - планувальник;
  • пам'ять поза розмовою - сховище стану;
  • перевірник - окремий споживач результату з логікою повтору;
  • застряглі задачі - черга помилок;
  • підключення до зовнішніх сервісів - зовнішні сигнали та інтеграції.

Найкраще це працює для механічної, повторюваної і добре перевірюваної роботи, де завдання можна розбити на чіткі кроки з перевіркою. Для продуктових рішень, архітектури, безпеки, фінансових дій, змін у базі даних і всього, де потрібне судження, людина має залишатися у контурі прийняття рішення.

Cursor провів Compile 26 — свій день "розробника" про майбутнє програмування.

https://www.marketwatch.com/story/social-media-declared-cursor-dead-then-spacex-handed-the-ai-startup-a-60-billion-lifeline-50454e29
Michael Truell на Compile показував новий Composer — вже власну модель на 1.5T параметрів, яку Cursor тренував з нуля на більш ніж 100k Nvidia GPU від SpaceX/xAI. На його думку Cursor більше не просто "кращий VS Code з чатиком", а платформа для агентного програмування.

Можливо модель буде доступна й в Grok Build.

https://www.youtube.com/watch?v=fWa7uxyhVDE

https://www.youtube.com/@cursor_ai/videos
На офіційному YouTube-каналі потрохи викладають записи виступів. Короткі доповіді по 10-25 хвилин, багато розмов не про "AI замінить програмістів", а про те, як змінюється сама робота: пам'ять агентів, інфраструктура для паралельних агентів, роль PM, роль senior engineer, навчання, контроль якості.

Окрім роботи з агентами та їх пам'яттю є ще виступи про нотатки, представлення думок і робочі середовища, про агентність у мові, про ефективність інтелекту, про те, як зміщується робота інженера та інші не технічні теми.

Origin — GitHub для агентів
https://cursor.com/origin
Окремо найцікавіший анонс це Origin, нова Git-платформа від Cursor. На сайті вони називають її гіт для агентів. У виступі Origin прямо представили як agent-native Git platform, а в кінці підсумували це як початок конкуренції з GitHub.

Агенти тут можуть працювати з репозиторієм, створювати й обробляти PR, відповідати на коментарі, фіксити CI failures, розв'язувати merge conflicts і тегати людину тільки коли справді треба.

Зараз Origin вже працює для внутрішнього використання, а для всіх інших відкритий waitlist.

Схоже, Китай все активніше йде не тільки в моделі, а й у повні coding harness / agent app.

Kimi K2.7 і у Github Copilot
https://github.blog/changelog/2026-07-01-kimi-k2-7-is-now-available-in-github-copilot/
GitHub додав Kimi K2.7 Code у Copilot. Це перша open-weight модель, яку можна обрати у Copilot. Хоститься на Microsoft Azure.

MiMo-Code CLI від Xiaomi
https://mimo.xiaomi.com/mimocode
https://mimo.xiaomi.com/blog/mimo-code-long-horizon
https://github.com/XiaomiMiMo/MiMo-Code
Xiaomi розробляє свій open-source CLI MiMoCode. Вміє працювати з Git, checkpoint-и, task tree, subagents, compose mode, voice input. Має persistent memory на SQLite FTS5 та команди, /dream і /distill для витягування знань та повторюваних workflow у skills.

Цікаво, що це не просто "ще один CLI", а спроба зробити Codex/Claude Code-подібний агент із власною пам'яттю й режимами роботи. Є безкоштовний на старті MiMo Auto, OAuth через Xiaomi MiMo Platform, підтримка OpenAI-сумісних провайдерів.

ZCode застосунок v3 від Z.ai
https://zcode.z.ai/en
ZCode — desktop застосунок на MacOS/Windows/Linux під топову модель GLM-5.2, Z.ai з v3 оптимізує цілий agent harness саме під свою модель та тарифні плани. Виглядає як пряма копія Codex app.

Має керування плагінами, відкат файлів (file rewind) із безпековим саммарі (safety summary), покращені пропозиції команд для промптів, планування, рев'ю, деплой, завдання робочого простору (workspace tasks), навички (skills) та мультиагентну взаємодію. Можна керувати агентом через чат у WeChat, Feishu чи Telegram.

Обговорення
https://news.ycombinator.com/item?id=48753715
На HN головний нерв — довіра. ZCode не є open-source, на відміну від MiMoCode, тому люди питають про telemetry, sandboxing і чи запускати desktop agent на основній машині взагалі безпечно. Багато коментарів зводяться до практики: агентів краще запускати у VM/containers, давати їм окремі worktree, окремі GitHub deploy keys і мінімальний доступ до секретів.

Sonnet 5 - довше й дорожче
https://www.anthropic.com/news/claude-sonnet-5
Anthropic випустила Claude Sonnet 5. Позиціонування: найагентніший Sonnet, ближчий до Opus 4.8, але дешевший. Доступний у Claude, Claude Code і API як claude-sonnet-5. До 31 серпня 2026 ціна знижена до $2/$10 за млн input/output токенів, потім буде $3/$15. Opus 4.8 для порівняння — $5/$25.

Додатковий нюанс: новий tokenizer може рахувати той самий текст як 1.0-1.35x більше токенів залежно від контенту. Тобто "дешевший Sonnet" не завжди автоматично дешевший у реальному рахунку. Модель не така розумна, але показує кращі результати бо наполегливіша. Тому й токенів може дуже багато витрачати.

Обговорення
https://news.ycombinator.com/item?id=48736605
HN зустрів Sonnet 5 скептично. Багато хто питає, навіщо брати Sonnet 5 на high effort, якщо Opus 4.8 low/medium іноді дає кращий результат за долар. Інша претензія — моделі стають більш "агентними", але іноді переускладнюють прості задачі й самі генерують зайву роботу.

Новини від OpenAI.

GPT-5.5-Cyber і ініціатива Daybreak
https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
Анонсували реліз моделі GPT-5.5-Cyber у рамках ініціативи Daybreak. Модель заточена під захисну безпеку: пошук вразливостей, threat modeling, генерація патчів для кодових баз. На бенчмарку CyberGym вона набрала 85.6% — більше за базовий GPT-5.5 (81.8%) і Anthropic Mythos 5 (83.8%). Наразі доступ — лише для верифікованих організацій.

Codex: скидання rate-limit
https://community.openai.com/t/flexible-rate-limit-resets-for-codex-and-a-method-to-get-a-reset/1383470
Головна зміна червня 2026 — banked rate-limit resets. Механізм: якщо протягом 5-годинного вікна не вибрати увесь ліміт — залишок «банкується» і зберігається як окремий reset, який можна використати пізніше. Це не API-кредити і не гроші на балансі — виключно додатковий ліміт у межах підписки ChatGPT. Він діє 30 днів від моменту нарахування.

Кожен користувач Plus/Pro отримав один безкоштовний reset, ще до трьох можна заробити рефералами до 24 червня. У деяких не з'являлися до першого рефералу. Активувати банкований reset можна через Codex desktop app у розділі Settings → Usage remaining. Є нюанс: (деякі Linux і) CLI-користувачі та VSCode-плагін-користувачі поки не мають нативного способу це зробити — тільки десктопний застосунок. У спільноті вже з'явились неофіційні скрипти для CLI-обходу.

Також з'явився екран Codex Profile — там видно usage stats і графіки активності токенів, що особливо корисно з переходом на токенний білінг.

Codex-Maxxing — гайд для довгих сесій
https://openai.com/index/codex-maxxing-long-running-work/
OpenAI опублікувала PDF офіційний гайд / white paper Codex-Maxxing. Це методичка про те, як можна використовувати Codex як постійного робочого агента, який веде довготривалі проєкти, а не просто відповідає на окремі запити. OpenAI бачить майбутнє не в тому, щоб кожного разу починати новий чат.

Термін "Codex-maxxing" тут використовується як назва підходу: не просто задавати питання Codex, а будувати навколо систему роботи:

  • Codex може й має працювати не тільки з кодом. Може керувати як комп'ютером, так і тільки браузером чи мати MCP доступ до пошти/календаря/ітд.
  • замість окремих чатів — постійні потоки роботи (Durable Threads) із накопиченою історією проекту і стиснення контексту (compaction.
  • пам'ять агента повинна бути видимою й відокремленою. Репозиторії зберігають код. Vault (окрема папка) зберігає контекст, рішення, відкрити цикли, поточний стан роботи, тощо.
  • steering — керування під час роботи. Ми не кидаємо завданнях і чекаємо щоб оцінити результат, тепер дивимося що відбувається й в реальному часі дорозповідаємо агенту правки. Взаємодія нагадує роботу з живим співробітником. Дивимося не в чат, а на саму роботу (документи, код) й коментуємо конкретно що де треба по іншому.
  • голос краще за текст + доступ з телефону. OpenAI вважає, що люди текстом часто вводять занадто "відредаговані" запити, а голос дозволяє передати емоції, сирі ідеї, уривки думок які сучасні моделі вже можуть брати до роботи. Ідеш гуляти та розмовляти з агентом з телефону, поки він працює за комп'ютером.
  • використовувати Heartbeats, вони ж Thread Automation — заплановані автоматичні перевірки які дозволяють агенту моніторити стан репозиторію або CI-пайплайну без участі людини. Агент не чекає нового повідомлення від користувача, а сам повертається до задачі за розкладом.

Задачі формулюються через чіткі верифіковані критерії виходу — наприклад, «покрити 100% тестами» або «скоротити час деплою на 30%» — і агент працює автономно до їх досягнення з перевірками. Погана сформульована задача це "Реалізуй весь план", добра це "Перенеси бібліотеку на Rust, збережи API сумісним і вважай задачу завершеною лише тоді, коли всі старі тести проходять успішно."

Китайські ШІ сервіси продовжують потрохи наздоганяти США варіанти.

TRAE Solo тепер Work
https://solo.trae.cn/
https://docs.trae.ai/solo/what-is-trae-solo?_lang=en
ByteDance перейменувала свій інструмент «Trae Solo» на Trae Work, підкреслюючи зміну позиціонування: від простого асистента розробника до повноцінного автономного «ШІ-співробітника» для виконання різних завдань (збір даних, створення контенту, веб дослідження, тощо). Code залишається як окрема вкладка, є конектор до GitHub. За інтерфейсом схоже на Codex app, наявні Skills та MCP з каталогом. Інструмент доступний у вебі, на десктопі та на мобільному телефоні. За замовчуванням для нових аккаунтів "Privacy Mode" вимкнений, тому треба самому його активувати.

Розумна GLM-5.2
https://docs.z.ai/guides/llm/glm-5.2
https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index
Zhipu AI випустила GLM-5.2 — Mixture-of-Experts (MoE) модель на 753B параметрів під ліцензією MIT, що значно покращує показники GLM-5.1. Контекстне вікно розширили до 1M токенів (проти 200k у попередника).

https://www.youtube.com/watch?v=nODxez6nZEU

Модель посіла перше місце серед open-source моделей у рейтингу Artificial Analysis Intelligence Index (v4.1) з оцінкою 51, демонструючи кодинг-навички на рівні пропрієтарної Claude Opus 4.8. В цілому вона більше заплутуєтся й споживає більше токенів, але видає результати.

Обговорення
https://news.ycombinator.com/item?id=48567759
На Hacker News модель хвалять за співвідношення ціни та можливостей на довгих циклах розробки. Водночас користувачі зазначають, що режим міркувань «Max» є вкрай повільним та витрачає багато токенів. Через великий розмір (753B) локальний запуск на звичайних MacBook Pro неможливий, але можливо купувати GPU-хмару чи через https://openrouter.ai/z-ai/glm-5.2#providers.

На сьогодні рейтингу ТОП моделей для програмування на OpenRouter за обсягом використання (кількістю токенів):

  1. MiMo-V2.5 (від xiaomi) — впевнений лідер рейтингу з обсягом 4.59T (трильйонів) токенів, що становить 22.5% від загальної частки ринку.
  2. MiniMax M3 (від minimax) — посідає друге місце з показником 2.45T токенів (12.0%).
  3. Hy3 preview (від tencent) — третє місце з обсягом 1.43T токенів (7.0%).
  4. Claude Opus 4.7 (від anthropic) — четверте місце, на яке припадає 1.17T токенів (5.7%).
  5. DeepSeek V4 Pro (від deepseek) — замикає першу п'ятірку з обсягом 1.14T токенів (5.6%).
  6. DeepSeek V4 Flash (від deepseek) — шосте місце з показником 972B (мільярдів) токенів (4.8%).
  7. GLM 5.1 (від z-ai) — сьоме місце з 952B токенів (4.7%).
  8. GLM 5.2 (від z-ai) — восьме місце з 820B токенів (4.0%).

GLM-5.2 у OpenCode
https://dev.to/danielbergholz/testing-glm-52-on-opencode-im-impressed-1780
Автор статті Даніель Бергхольц протестував її в реальних умовах розробки, інтегрувавши GLM-5.2 через OpenRouter у безкоштовний кодинг-агент OpenCode.

У практичному тесті на реальному проєкті Next.js модель мала розробити функціонал фільтрації статей із дебаунсом у 300 мс без засмічення історії браузера. GLM-5.2 показала себе як дещо повільна, але вдумлива модель: у режимі планування вона без додаткових підказок проаналізувала архітектуру проєкту, зрозуміла різницю між серверними й клієнтськими компонентами та логічно пояснила вибір саме клієнтського рендерингу для цього завдання. Вона з першої спроби («one-shot») написала чистий, робочий код і виявила рідкісну для ШІ-помічників «стриманість», не намагаючись ускладнити наявну структуру проєкту.

Весь сеанс роботи, що включав дослідження репозиторію, планування, написання коду, рев'ю та фінальне виправлення, коштував автору лише $0,265 (менше 27 центів).

Якість генерації коду продовжує зростати, але уряд США намагається не допустити до цього інших людей.

Fable 5 - прибрали за 3 дні
https://www.anthropic.com/news/claude-fable-5-mythos-5
https://support.claude.com/en/articles/14328960-identity-verification-on-claude
9 червня 2026 року Anthropic презентувала Claude Fable 5 — модель нового Mythos-класу. Тести показали рекордний рівень автономності (проходження ігор за допомогою комп'ютерного зору) в тому числі в створенні коду.

https://www.youtube.com/watch?v=LoIGVdfTq9M

Проте вже за 3 дні доступ до моделей призупинили: уряд США видав експортну директиву, яка забороняє користування моделями будь-яким іноземним громадянам (foreign nationals). Через неможливість миттєво відсіяти іноземців Anthropic вимкнула моделі для всіх клієнтів.

Щоб вирішити проблему, компанія запускає обов’язкову верифікацію особи (ID + селфі) через сервіс Persona. Сама процедура глобальна й підтримує документи більшості країн. Проте доступ до топової Fable 5 через вимоги США отримають тільки підтверджені американські громадяни та резиденти.

Обговорення
https://news.ycombinator.com/item?id=48618455
Спільнота на Hacker News сприйняла нововведення вкрай негативно. Багато розробників з інших країн зазначають, що оплачувати підписку Anthropic тепер безглуздо, оскільки вони не отримають доступу до майбутніх флагманів. Введення верифікації через Persona викликає серйозні побоювання щодо приватності, а раптове відключення Fable 5 підірвало довіру до американських SaaS як надійного фундаменту для бізнесу.

Хоча зараз ця топова модель залишається доступною лише обраному колу осіб — військовим та співробітникам самої компанії Anthropic, — я думаю це тимчасове явище. Очевидно, що OpenAI вже готує свою відповідь у вигляді GPT-6, а Google також веде активні розробки у цьому напрямі. Тому поява у широкому доступі моделей наступного покоління з якісно новим рівнем автономності та генерації коду — це лише питання найближчих місяців. Почекаємо

Китайський ШІ-гігант MiniMax анонсував нове покоління моделей М, це буде M3.

MiniMax M3
https://www.minimax.io/blog/minimax-m3
https://www.minimax.io/models/text/m3
MiniMax-M3 зроблена з акцентом на глибокий reasoning, coding та автономні пайплайни, бере текст + image + video на вході, видає текст на виході. Модель спеціально оптимізована для agentic-роботи та складних, довгострокових завдань, а не просто чат-інтеракцій.

MiniMax Sparse Attention (MSA) — нова sparse attention-механізм, який радикально знижує обчислювальні витрати на довгому контексті (приблизно 1/20 від попереднього покоління). До 1M токенів, також гарантовано мінімум 512K в більш дешевому варіанті API. Є Token Plans (від $20/міс), підкреслюють можливість варіанту $50/міс.

Тести виглядають круто. SWE-Bench Pro ~59% та Terminal-Bench 2.1 ~66% Це на рівні GPT-5.5 та Gemini 3.1 Pro, відстає тільки від Claude Opus 4.8. На хакерньюз обговорень активних немає.

Оновлення MiniMax Code
https://code.minimax.io/
З оновленням M3 MiniMax Code також отримав значне оновлення та максимально використовує можливості моделі: довгий контекст, agentic-навички та native multimodality. Программа може не тільки генерувати код, а й робити документи/PDF/слайди/таблиці/іконки. Завдяки мультимодальності, MiniMax Code підтримує computer use (управління комп’ютером).

Концепція будується навколо делегування коли ви не пишете код разом з ШІ, ви ним керуєте: Producer + Verifier adversarial loop — агенти постійно генерують, рефлексують, перевіряють і виправляють помилки в реальному часі. Є варіант Smart Authorize щоб постійно не моніторити кожну дію агентів.

https://www.youtube.com/watch?v=mBHFGeU18MI

Є нативна підтримка MCP-серверів для підключення зовнішніх баз даних та документації. Є маркетплейз скілов. Є можливість інтеграції з ботом в телеграм, WeChat, Lark, щоб керувати агентами з телефону. Можлива автономна робота протягом днів без втручання людини. Також запуск завдань за розкладом.

Microsoft на своєму травневому Build 2026 презентували ряд змін, в напрямку переходу від простого AI-асистування до автономних агентів.

Власні моделі MAI
https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/
Показали нову родину моделей MAI (Microsoft AI) це аж 7 шт, зокрема MAI-Code-1-Flash та MAI-Thinking-1. Microsoft фактично зменшує залежність від OpenAI. Компанія заявляє про frontier-рівень результатів для автономних задач.

Модель MAI-Code-1-Flash має 5B активних з 137B параметрів (тобто середнього розміру) та вікно контексту на 2 мільйони токенів (тобто дуже велике), працює з рекордно низькою затримкою. На презентаційних слайдах усе виглядає ідеально: заявляють, що обходить старі покоління флагманської GPT-4o. Її відкрито позиціонують як базовий двигун для пайплайнів, що буде інтегрований у GitHub Copilot, VS Code та інших продуктів MS.

Обговорення
https://news.ycombinator.com/item?id=48374466
Доволі активное обговоренні на Hacker News (яке зібрало понад 600 коментарів за добу) люди зазначають, що відкриті моделі на кшталт Qwen 3.6 (35B) або DeepSeek V4 Flash видають кращі результати і працюють в рази швидше, тоді як новий жорсткий токен-білінг GitHub Copilot може зробити використання MAI-Code-1-Flash економічно невигідним.

GitHub Copilot — тепер це окрема програма
https://github.blog/2026-06-02-github-copilot-app-the-agent-native-desktop-experience/
Колись Copilot був плагіном у VS Code, потім став його частиною. Тепер вслід за Codex, Curosr, Zed та іншими Microsoft вирішили робити окремий GitHub Copilot App — «agent-native» чат посередені десктопний додаток.

Це єдиний центр управління (control plane) для агентів, які паралельно працюють в ізольованих git-деревах, створюють PR та дебажать код. Вони радикально відходять від концепції редактора у бік делегування цілих воркфлоу. Є підтримка MCP-серверів.

https://www.youtube.com/watch?v=5Q5mLNYJ6Hw

Замість того, щоб губитися на сайті GitHub, у додатку є зручна вкладка On your radar (або Inbox), де зібрані всі ваші Pull Requests (PR) та Issues з обраних репозиторіїв. Можна відкрити будь-який PR, переглянути зміни в коді (diff), залишити коментар або заапрувити його. Більше того, можна тегнути @copilot прямо в коментарях, щоб він щось виправив чи пояснив.

Можна створювати "швидкі чати" для загальних питань (навіть не пов'язаних з кодом, наприклад, для ігор D&D), або сесії, прив'язані до конкретного репозиторію. У додатку можна перемикатися між різними LLM. Автор, наприклад, використовує модель Claude Opus 4.7 для генерації коду.

Ізоляція агентів: MXC (Microsoft Execution Containers)
https://www.microsoft.com/en-us/security/blog/2026/06/02/microsoft-build-2026-securing-code-agents-and-models/
Через те, що агенти тепер виконують реальний код, лазять по системах та інфраструктурі, Microsoft впроваджує MXC на рівні ядра Windows 11. Це новий рівень ізоляції та sandboxing спеціально для AI-додатків. Windows фактично перетворюється на "Agent Runtime" платформу.

На демонстрації показали як OpenClaw намагається видалити всі файли з робочого стола і як йому це не вдається.

Ще нові моделі травня.

Cursor Composer 2.5
https://cursor.com/blog/composer-2-5
18 травня 2026 року команда Cursor випустила модель Composer 2.5, яка базується на тій самій відкритій моделі Kimi K2.5 від Moonshot AI, але тепер близько 85% це власне донавчання Cursor. Головна зміна порівняно з Composer 2 — зростання автономності та оптимізація вартості.

Модель пропонує два тарифи: Standard за $0.50 за млн вхідних і $2.50 за млн вихідних токенів, та Fast за $3/$15. У тестах SWE-Bench Pro досягла 49% успішності (проти 12% у Composer 2), тобто навички кодингу та розуміння контексту зросли в рази за доволі прийнятну ціну.

Qwen 3.7 Max
https://qwen.ai/blog?id=qwen3.7
20 травня 2026 року на Alibaba Cloud Summit було анонсовано Qwen3.7-Max. На відміну від попередньої лінійки Qwen 3.6, яка орієнтувалася на загальні завдання, нова версія позиціонується виключно як агентна модель для наддовгих циклів автономної роботи. Головна зміна — стійкість на довгих завданнях.

Alibaba продемонструвала кейс, де модель повністю автономно оптимізувала GPU-ядро протягом 35 годин без жодної участі людини, виконавши понад 1100 викликів інструментів. Контекстне вікно розширили до 1 млн токенів (проти 256k у попередника), а також підвищили "щільність" міркувань на токен.

Qwen3.7-Max може генерувати складні інтерактивні вебзастосунки з одного запиту — включаючи 3D-сцени на Three.js, анімації Canvas, повносторінкові макети та динамічні SVG.

https://openrouter.ai/qwen/qwen3.7-max
Зараз 50% знижка на модель у OpenRouter ($1.25/$3.75), що робить Qwen 3.7 Max поки що чи не найкращим вибором за співвідношенням ціна/можливості для довгих запусків.

Claude Opus 4.8 — менше галюцинацій та більше контролю
https://www.anthropic.com/news/claude-opus-4-8
28 травня 2026 року Anthropic представили Claude Opus 4.8 (ціна така ж як була у 4.7 $5/$25 за млн токенів) й знову очолили глобальний рейтинг Artificial Analysis з оцінкою 61.4, обійшовши GPT-5.5.

Замість фокуса на абстрактних бенчмарках Anthropic зробили ставку на "чесність" системи: модель навчилася прямо говорити "я не знаю" або просити уточнення, а також у 4 рази рідше пропускає приховані баги у власному коді порівняно з Opus 4.7.

В Claude Code з'явилися dynamic workflows. Тепер Opus 4.8 може самостійно планувати масштабне завдання, запускати паралельних субагентів і перевіряти результат перед здачею роботи.

Google на травневому I/O 2026 вже почав «закручувати гайки» та радикально перекроювати свою інфраструктуру для розробників.

Gemini 3.5 Flash
https://deepmind.google/models/gemini-3-5-flash/
Головним "двигуном" анонсу стала модель Gemini 3.5 Flash, яка передує майбутній 3.5 Pro. Google заявляє, що модель працює значно швидше за попередні покоління та показує frontier-рівень результатів у задачах agentic coding: ~76.2% на Terminal Bench 2.1 та ~55.1% на SWE-Bench Pro.

Нова Flash в рази дорожча за попередню, а масове використання агентів швидко спалює токени та compute.

Тариф за $100.
https://blog.google/innovation-and-ai/technology/ai/google-io-2026-all-our-announcements/
Google вводить новий тарифний план — Google AI Ultra за $100 на місяць, який дає вищі ліміти на використання агентів в Antigravity. Також оновлюється дорожчий enterprise-рівень: замість простих лімітів на повідомлення все більше використовується модель «compute-used» — фактична оплата за ресурси агентів та execution.

Все буде Antigravity
https://antigravity.google/blog/introducing-google-antigravity-2-0
Раніше Project IDX базувався на Code OSS (відкритому VS Code). Тепер стратегія змінилася: Google активно переводить фокус з IDX та Firebase Studio у бік Antigravity.

Замість розрізнених інструментів тепер просувається Antigravity 2.0 — «agent-first» платформа для розробки за популярним останніми місяцями підходом чат-посередені. Це пряма відповідь на Codex app та Cursor 3, але з повним контролем з боку Google над execution environment, sandboxing та orchestration агентів. Вони теж відходять від редакторів "як VS Code", але радикально прибрали редактор тексту зовсім.

https://www.youtube.com/watch?v=3arUEZlv9mc

Судячи з малоактивного обговорення на Hacker News і перших відгуків про Antigravity 2, виглядає так, що багато розробників взагалі не перейшли до активного використання інструменту після запуску — він сприймається радше як ще один експериментальний AI-IDE, ніж як стабільний робочий інструмент.

Від Gemini CLI до Antigravity CLI
https://developers.googleblog.com/an-important-update-transitioning-gemini-cli-to-antigravity-cli/
Google офіційно оголосив про закриття старих інструментів. Особливо швидко зникне з 18 червня 2026 року Gemini CLI (відкритий код, щоденні квоти) та розширення Gemini Code Assist - вони припиняють обслуговувати запити для безкоштовних користувачів та навіть для підписників AI Pro/Ultra, залишиться тільки для Enterprise.

Google фактично переводить фокус з Gemini CLI та Gemini Code Assist на новий Antigravity CLI (закритий код), який стає основним термінальним інструментом для agentic workflows. Квоти тепер більше схожі не на «кількість промптів», а на модель compute usage — скільки агентів та ресурсів реально використовуєш. Зараз вона працює дуже погано й скоріше збирає баг-репорти, ніж є інструментом розробника.

Окрім моделей Google, у наявності також дві моделі Claude від Anthropic і чомусь GPT-OSS 120B від OpenAI. Все.

Нативний Android в Google AI Studio
https://android-developers.googleblog.com/2026/05/build-android-apps-google-ai-studio.html
В Google AI Studio тепер можна з промпту згенерувати нативний Android-додаток (Kotlin/Jetpack Compose) і запустити його в емуляторі прямо в браузері.

Якщо проект стає складним — Google пропонує «безшовний» експорт в Android Studio для подальшої agentic-розробки.

Кілька цікавих апдейтів за травень. На фоні новин про xAI, Anthropic теж здивували, оголосивши 6 травня про партнерство зі SpaceX для розширення своїх обчислювальних потужностей.

Знижки від Anthropic та перехід на нове ціноутворення
https://www.anthropic.com/news/higher-limits-spacex
Anthropic оголосила про тимчасову "весняну знижку" на використання API своїх моделей. Також перестали блокувати використання у стилі OpenClaw. Але це радше спроба загладити кути перед великими змінами: компанія все частіше натякає на перегляд класичної моделі «фіксована підписка — безлімітний чат».

Замість оплати "за токени" впроваджується динамічний прайсинг (Compute-based pricing). Вартість запиту залежатиме від того, скільки обчислювальних ресурсів модель витратила на "міркування" (reasoning).

Оновлення Claude Code
https://code.claude.com/docs/en/whats-new#week-18
У windows нарешті Claude Code більше не вимагає встановленого Git Bash, якщо він відсутній, інструмент тепер нативно використовує PowerShell.

Робота у хмарі. Відкрили публічний доступ (research preview) до нової команди /ultrareview яка піднімає декілька автономних ШІ-агентів у хмарі, які паралельно перевіряють репозиторій на вразливості та баги. До цього ще запустили команду /ultraplan - велике завдання планування пушится на сервери Anthropic, де під нього піднімається ізольована віртуальна машина (4 ядра CPU, 16 ГБ RAM, зі встановленими Node.js, Python, Rust, Docker тощо), а після видає посилання на веб-інтерфейс з результатами.

Керування OpenAI Codex з мобільного
https://openai.com/news/codex-mobile-app/
У відповідь на схожу функцію у Cluade Code OpenAI випустила оновлення для Codex, яке дозволяє керувати AI-агентами зі смартфона. Тепер розробникам не обов'язково бути біля ноутбука: можна апрувити pull requests, запускати пайплайни тестування, вирішувати конфлікти злиття або давати промпти на фікс дрібних багів на ходу. Інтерфейс максимально оптимізовано під голос та швидкі команди — по суті, це кишеньковий пульт до агента на комп'ютері.

Gemma-моделі у Gemini CLI
https://cloud.google.com/blog/products/gcp-cli-gemma
Оновлення термінального клієнта Gemini CLI (v0.40.0) додало експериментальну інтеграцію локальних моделей Gemma. У v0.41.0 з’явилась підтримка Gemma 4 models (experimental). Поки що для інтелектуального роутингу запитів (Model Routing) й повністю offline agent execution поки немає, але команда вже готує повноцінне виконання завдань локально.

Ще покращили роботи за пам'яттю. Tiered Memory (багаторівнева пам'ять) дозволяє агенту зберігати контекст прямо в Markdown-файлах на чотирьох рівнях: від глобальних стилів розробника (у ~/.gemini/GEMINI.md) до правил конкретної директорії проекту. А нова функція Auto Memory фоново аналізує старі сесії, знаходить вдалі рішення і пропонує зберегти їх як багаторазові навички у SKILL.md. Auto Memory Inbox (з v0.42) це система, яка автоматично збирає, класифікує та пропонує важливі фрагменти інформації для довготривалої пам’яті AI-асистента.

Також покращили голосовий режим.

Якщо казати про всіх великих гравців LLM, то тільки xAI на сьогодні не заробляють на розробниках та програмістах. Схоже почали це виправляти.

Cursor та xAI
https://techsifted.com/posts/spacex-cursor-acquisition-april-2026/
SpaceX/xAI отримує опціон на купівлю Cursor за $60 млрд, якщо купівля не відбудеться — Cursor все одно отримає $10 млрд за партнерство та спільну R&D-роботу. Це право купити компанію пізніше за зафіксованою ціною.

В березні кілька ключових інженерів Cursor переходять працювати в xAI. У травні Cursor починає масштабну міжнародну експансію та найм. Якщо інфраструктура xAI зробить наступні версії ще потужнішими, більшість користувачів Cursor, ймовірно, залишаться.

Реакція розробників неоднозначна. Частина аудиторії Cursor обирала його саме через незалежність — не OpenAI, не Microsoft і не Google, а будь яка їх модель за бажанням. Тепер сервіс потенційно опиняється в екосистемі Ілона Маска чи це вплине на пріоритет моделі Grok поки не зрозуміло.

Дотренування Grok на даних Cursor
https://x.com/elonmusk/status/2055914584373141906
17 травня xAI завершила первинне тренування величезної моделі Grok V9 (1.5 трильйона параметрів). Наступний етап — supplemental training з використанням даних від Cursor. Це дозволить моделям Grok значно покращити кодинг-навички, адже Cursor зібрало величезну базу якісного коду від розробників.

Запуск Grok Build CLI
https://x.ai/news/grok-build-cli https://x.ai/cli
14 травня xAI випустила раню beta версію Grok Build — агента для генерації коду: планування задач, підагенти для паралельної роботи, headless режим для скриптів, підтримка AGENTS.md, diff, плагінів тощо. Все як у дорослих. Це прямий конкурент Claude Code та подібних інструментів.

Але доступний на зараз тільки для підписки SuperGrok Heavy (план за 300$ - є три дні тріал), працює в терміналі тільки Linux/macOS. В windows тільки через WSL. Оновлення виходять майже щодня, користувачі вже хвалять швидкість і якість. Elon Musk особисто просить фідбек.

https://www.youtube.com/watch?v=l_dAOKHLiYw

xAI зараз пропонує акційну підписку на SuperGrok Heavy: замість $300 на місяць тариф тимчасово коштує близько $99 протягом перших шести місяців. Але користувачі скаржаться, що навіть Heavy не відчувається “безлімітним”, а реальні ліміти можуть змінюватись залежно від навантаження на систему.

БД видалив не ШІ
https://idiallo.com/blog/ai-didnt-delete-your-database-you-did
Став популярним твіт: засновник стартапу заявив, що ШІ-агент за кілька секунд повністю видалив їхню продакшн-базу даних. Він обурювався, допитував модель і шукав винних у «поганому AI». Але автор статті каже: це не ШІ винен. Проблема в тому, що в продакшені існував публічний API-ендпоінт, який міг одним запитом знищити всю базу.

Це як поставити кнопку самознищення на видному місці й дивуватися, коли хтось її натиснув. Ibrahim Diallo каже, що не ШІ видалив базу — це зробили самі розробники небезпечною архітектурою, відсутністю захисту й безвідповідальністю. ШІ просто виявив те, що вони недбало залишили.

Обговорення
https://news.ycombinator.com/item?id=48022742
Більшість людей повністю згодні зі статтею: не ШІ винен, а той, хто дав агенту необмежений доступ до продакшену, не обмежив права API-токена і не поставив захистів. Інструмент може бути небезпечним, але відповідальність завжди на операторі. Багато хто критикує «AI-maximalism» — коли розробники з ентузіазмом дають агентам повний доступ замість sandbox і review.

10 уроків кодінгу з агентом
https://www.dbreunig.com/2026/05/04/10-lessons-for-agentic-coding.html
Завдяки сучасним ШІ-агентам код став надзвичайно дешевим у створенні, але дорогим в підтримці, безпеці та супроводі. Це повністю змінює підхід до розробки: тепер головне — не економити на написанні коду, а грамотно використовувати цю дешевизну.

  1. Впроваджуй, щоб навчатися. За допомогою Spec-Driven Development можна зайти далеко, але сам процес написання коду виявляє рішення, про які ви не подумали, і робить ваш spec кращим. Коли код дешевий – впроваджуй, щоб навчатися.
  2. Перебудовуй часто. Впроваджуй рано і часто, щоб дізнатися більше. Форкай і переписуй божевільні експерименти. Дізнавайся, як далеко можна завести фічу. Звісно, хочеться ітерувати та накопичувати зусилля, але дешевий код означає, що ви можете розвідувати та переосмислювати такими способами, які раніше були неможливими.
  3. Інвестуй у наскрізні тести. Коли ми можемо дешево переосмислювати свій код, варто витрачати час на написання тестів, які вимірюють функції нашого продукту, а не те, як він їх виконує. Нам потрібні поведінкові контракти, які дають свободу перебудовувати та перевпроваджувати.
  4. Документуй наміри. Тести деталізують наші цілі, а код кодує наші методи, але жоден із них не фіксує «чому». Ваш намір мотивує ваші рішення, і збереження його поряд із кодом допомагає вам і вашому агенту накопичувати ці рішення в послідовному напрямку.
  5. Тримай свої spec-и синхронізованими. Оновлюй свої spec-и (markdown-файли з вашими цілями та планами) у міру того, як просувається ваш код і ваші тести. Якщо ставитися до spec-у як до замороженого артефакту, написаного до початку роботи, ви втратите можливість фіксувати навчання під час впровадження. Підтримка його актуальності дозволяє постійно впливати на ваші рішення та рішення ваших агентів, а також полегшує часті перебудови.
  6. Знаходь складні речі. Працюй над проєктом досить довго – і речі перестануть бути легкими. Ви швидко пролітаєте шаблонну роботу, очевидні дизайнерські рішення і починаєте натикатися на потворну, важку роботу: інтуїтивний дизайн, продуктивність, безпека, стійкість і системна архітектура. Будь-хто може «профінтити» легкі речі. Цінність – у важкій роботі. Знайди її і занурюйся.
  7. Автоматизуй усе, що легко. Щоб більше часу приділяти складним речам, мінімізуй час на легкі. Перетворюй навчання на навички, будуй цикли, автоматизуй рев'ю коду, дозволь інструментам накопичувати ефект. Але обережно: не застрягай у «Таємничому будинку».
  8. Розвивай свій смак. Коли код приходить швидко, а зворотний зв'язок – ні, єдиним джерелом зворотного зв'язку, яке встигає, є ви самі. Чим краще ви знаєте свою доменну область, своїх користувачів та їхні проблеми, тим далі ви зможете зайти без узгодження.
  9. Агенти підсилюють досвід. Талановиті розробники недооцінюють, скільки інтуїції вони вкладають у свої промпти: правильні терміни, правильне формулювання, правильний рівень конкретики. Якщо ви знаєте свій стек, ви можете заощадити безліч циклів як під час впровадження, так і під час налагодження, а також скоротити непотрібне дослідження агента. Поєднуйте технічну експертизу з чудовим смаком для непереможної переваги.
  10. Код дешевий, але супровід, підтримка та безпека – ні. Агентний код є «безкоштовним, як цуценята». Підтримка не дешева, і безпека теж. Будуй швидко, але пам'ятай про супровід, який ти береш на себе.

Обговорення
https://news.ycombinator.com/item?id=48019025
активне й переважно позитивне — багато хто вважає її однією з найпрактичніших і тверезих публікацій про роботу з ШІ-агентами. Більшість людей згодні з автором: код став надзвичайно дешевим, тому фокус має зміститися на архітектуру, безпеку, end-to-end тести, підтримку та «смак» (taste). Є й скептики: деякі вважають, що кодинг — лише мала частина роботи, бізнес- та організаційні bottleneck нікуди не дінуться, а в великих компаніях швидкість розробки не є головним обмеженням.