CodeWithLLM-Updates
-

Microsoft на своєму травневому Build 2026 презентували ряд змін, в напрямку переходу від простого AI-асистування до автономних агентів.

Власні моделі MAI
https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/
Показали нову родину моделей MAI (Microsoft AI) це аж 7 шт, зокрема MAI-Code-1-Flash та MAI-Thinking-1. Microsoft фактично зменшує залежність від OpenAI. Компанія заявляє про frontier-рівень результатів для автономних задач.

Модель MAI-Code-1-Flash має 5B активних з 137B параметрів (тобто середнього розміру) та вікно контексту на 2 мільйони токенів (тобто дуже велике), працює з рекордно низькою затримкою. На презентаційних слайдах усе виглядає ідеально: заявляють, що обходить старі покоління флагманської GPT-4o. Її відкрито позиціонують як базовий двигун для пайплайнів, що буде інтегрований у GitHub Copilot, VS Code та інших продуктів MS.

Обговорення
https://news.ycombinator.com/item?id=48374466
Доволі активное обговоренні на Hacker News (яке зібрало понад 600 коментарів за добу) люди зазначають, що відкриті моделі на кшталт Qwen 3.6 (35B) або DeepSeek V4 Flash видають кращі результати і працюють в рази швидше, тоді як новий жорсткий токен-білінг GitHub Copilot може зробити використання MAI-Code-1-Flash економічно невигідним.

GitHub Copilot — тепер це окрема програма
https://github.blog/2026-06-02-github-copilot-app-the-agent-native-desktop-experience/
Колись Copilot був плагіном у VS Code, потім став його частиною. Тепер вслід за Codex, Curosr, Zed та іншими Microsoft вирішили робити окремий GitHub Copilot App — «agent-native» чат посередені десктопний додаток.

Це єдиний центр управління (control plane) для агентів, які паралельно працюють в ізольованих git-деревах, створюють PR та дебажать код. Вони радикально відходять від концепції редактора у бік делегування цілих воркфлоу. Є підтримка MCP-серверів.

https://www.youtube.com/watch?v=5Q5mLNYJ6Hw

Замість того, щоб губитися на сайті GitHub, у додатку є зручна вкладка On your radar (або Inbox), де зібрані всі ваші Pull Requests (PR) та Issues з обраних репозиторіїв. Можна відкрити будь-який PR, переглянути зміни в коді (diff), залишити коментар або заапрувити його. Більше того, можна тегнути @copilot прямо в коментарях, щоб він щось виправив чи пояснив.

Можна створювати "швидкі чати" для загальних питань (навіть не пов'язаних з кодом, наприклад, для ігор D&D), або сесії, прив'язані до конкретного репозиторію. У додатку можна перемикатися між різними LLM. Автор, наприклад, використовує модель Claude Opus 4.7 для генерації коду.

Ізоляція агентів: MXC (Microsoft Execution Containers)
https://www.microsoft.com/en-us/security/blog/2026/06/02/microsoft-build-2026-securing-code-agents-and-models/
Через те, що агенти тепер виконують реальний код, лазять по системах та інфраструктурі, Microsoft впроваджує MXC на рівні ядра Windows 11. Це новий рівень ізоляції та sandboxing спеціально для AI-додатків. Windows фактично перетворюється на "Agent Runtime" платформу.

На демонстрації показали як OpenClaw намагається видалити всі файли з робочого стола і як йому це не вдається.

Китайський ШІ-гігант MiniMax анонсував нове покоління моделей М, це буде M3.

MiniMax M3
https://www.minimax.io/blog/minimax-m3
https://www.minimax.io/models/text/m3
MiniMax-M3 зроблена з акцентом на глибокий reasoning, coding та автономні пайплайни, бере текст + image + video на вході, видає текст на виході. Модель спеціально оптимізована для agentic-роботи та складних, довгострокових завдань, а не просто чат-інтеракцій.

MiniMax Sparse Attention (MSA) — нова sparse attention-механізм, який радикально знижує обчислювальні витрати на довгому контексті (приблизно 1/20 від попереднього покоління). До 1M токенів, також гарантовано мінімум 512K в більш дешевому варіанті API. Є Token Plans (від $20/міс), підкреслюють можливість варіанту $50/міс.

Тести виглядають круто. SWE-Bench Pro ~59% та Terminal-Bench 2.1 ~66% Це на рівні GPT-5.5 та Gemini 3.1 Pro, відстає тільки від Claude Opus 4.8. На хакерньюз обговорень активних немає.

Оновлення MiniMax Code
https://code.minimax.io/
З оновленням M3 MiniMax Code також отримав значне оновлення та максимально використовує можливості моделі: довгий контекст, agentic-навички та native multimodality. Программа може не тільки генерувати код, а й робити документи/PDF/слайди/таблиці/іконки. Завдяки мультимодальності, MiniMax Code підтримує computer use (управління комп’ютером).

Концепція будується навколо делегування коли ви не пишете код разом з ШІ, ви ним керуєте: Producer + Verifier adversarial loop — агенти постійно генерують, рефлексують, перевіряють і виправляють помилки в реальному часі. Є варіант Smart Authorize щоб постійно не моніторити кожну дію агентів.

https://www.youtube.com/watch?v=mBHFGeU18MI

Є нативна підтримка MCP-серверів для підключення зовнішніх баз даних та документації. Є маркетплейз скілов. Є можливість інтеграції з ботом в телеграм, WeChat, Lark, щоб керувати агентами з телефону. Можлива автономна робота протягом днів без втручання людини. Також запуск завдань за розкладом.

Якість генерації коду продовжує зростати, але уряд США намагається не допустити до цього інших людей.

Fable 5 - прибрали за 3 дні
https://www.anthropic.com/news/claude-fable-5-mythos-5
https://support.claude.com/en/articles/14328960-identity-verification-on-claude
9 червня 2026 року Anthropic презентувала Claude Fable 5 — модель нового Mythos-класу. Тести показали рекордний рівень автономності (проходження ігор за допомогою комп'ютерного зору) в тому числі в створенні коду.

https://www.youtube.com/watch?v=LoIGVdfTq9M

Проте вже за 3 дні доступ до моделей призупинили: уряд США видав експортну директиву, яка забороняє користування моделями будь-яким іноземним громадянам (foreign nationals). Через неможливість миттєво відсіяти іноземців Anthropic вимкнула моделі для всіх клієнтів.

Щоб вирішити проблему, компанія запускає обов’язкову верифікацію особи (ID + селфі) через сервіс Persona. Сама процедура глобальна й підтримує документи більшості країн. Проте доступ до топової Fable 5 через вимоги США отримають тільки підтверджені американські громадяни та резиденти.

Обговорення
https://news.ycombinator.com/item?id=48618455
Спільнота на Hacker News сприйняла нововведення вкрай негативно. Багато розробників з інших країн зазначають, що оплачувати підписку Anthropic тепер безглуздо, оскільки вони не отримають доступу до майбутніх флагманів. Введення верифікації через Persona викликає серйозні побоювання щодо приватності, а раптове відключення Fable 5 підірвало довіру до американських SaaS як надійного фундаменту для бізнесу.

Хоча зараз ця топова модель залишається доступною лише обраному колу осіб — військовим та співробітникам самої компанії Anthropic, — я думаю це тимчасове явище. Очевидно, що OpenAI вже готує свою відповідь у вигляді GPT-6, а Google також веде активні розробки у цьому напрямі. Тому поява у широкому доступі моделей наступного покоління з якісно новим рівнем автономності та генерації коду — це лише питання найближчих місяців. Почекаємо

Китайські ШІ сервіси продовжують потрохи наздоганяти США варіанти.

TRAE Solo тепер Work
https://solo.trae.cn/
https://docs.trae.ai/solo/what-is-trae-solo?_lang=en
ByteDance перейменувала свій інструмент «Trae Solo» на Trae Work, підкреслюючи зміну позиціонування: від простого асистента розробника до повноцінного автономного «ШІ-співробітника» для виконання різних завдань (збір даних, створення контенту, веб дослідження, тощо). Code залишається як окрема вкладка, є конектор до GitHub. За інтерфейсом схоже на Codex app, наявні Skills та MCP з каталогом. Інструмент доступний у вебі, на десктопі та на мобільному телефоні. За замовчуванням для нових аккаунтів "Privacy Mode" вимкнений, тому треба самому його активувати.

Розумна GLM-5.2
https://docs.z.ai/guides/llm/glm-5.2
https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index
Zhipu AI випустила GLM-5.2 — Mixture-of-Experts (MoE) модель на 753B параметрів під ліцензією MIT, що значно покращує показники GLM-5.1. Контекстне вікно розширили до 1M токенів (проти 200k у попередника).

https://www.youtube.com/watch?v=nODxez6nZEU

Модель посіла перше місце серед open-source моделей у рейтингу Artificial Analysis Intelligence Index (v4.1) з оцінкою 51, демонструючи кодинг-навички на рівні пропрієтарної Claude Opus 4.8. В цілому вона більше заплутуєтся й споживає більше токенів, але видає результати.

Обговорення
https://news.ycombinator.com/item?id=48567759
На Hacker News модель хвалять за співвідношення ціни та можливостей на довгих циклах розробки. Водночас користувачі зазначають, що режим міркувань «Max» є вкрай повільним та витрачає багато токенів. Через великий розмір (753B) локальний запуск на звичайних MacBook Pro неможливий, але можливо купувати GPU-хмару чи через https://openrouter.ai/z-ai/glm-5.2#providers.

На сьогодні рейтингу ТОП моделей для програмування на OpenRouter за обсягом використання (кількістю токенів):

  1. MiMo-V2.5 (від xiaomi) — впевнений лідер рейтингу з обсягом 4.59T (трильйонів) токенів, що становить 22.5% від загальної частки ринку.
  2. MiniMax M3 (від minimax) — посідає друге місце з показником 2.45T токенів (12.0%).
  3. Hy3 preview (від tencent) — третє місце з обсягом 1.43T токенів (7.0%).
  4. Claude Opus 4.7 (від anthropic) — четверте місце, на яке припадає 1.17T токенів (5.7%).
  5. DeepSeek V4 Pro (від deepseek) — замикає першу п'ятірку з обсягом 1.14T токенів (5.6%).
  6. DeepSeek V4 Flash (від deepseek) — шосте місце з показником 972B (мільярдів) токенів (4.8%).
  7. GLM 5.1 (від z-ai) — сьоме місце з 952B токенів (4.7%).
  8. GLM 5.2 (від z-ai) — восьме місце з 820B токенів (4.0%).

GLM-5.2 у OpenCode
https://dev.to/danielbergholz/testing-glm-52-on-opencode-im-impressed-1780
Автор статті Даніель Бергхольц протестував її в реальних умовах розробки, інтегрувавши GLM-5.2 через OpenRouter у безкоштовний кодинг-агент OpenCode.

У практичному тесті на реальному проєкті Next.js модель мала розробити функціонал фільтрації статей із дебаунсом у 300 мс без засмічення історії браузера. GLM-5.2 показала себе як дещо повільна, але вдумлива модель: у режимі планування вона без додаткових підказок проаналізувала архітектуру проєкту, зрозуміла різницю між серверними й клієнтськими компонентами та логічно пояснила вибір саме клієнтського рендерингу для цього завдання. Вона з першої спроби («one-shot») написала чистий, робочий код і виявила рідкісну для ШІ-помічників «стриманість», не намагаючись ускладнити наявну структуру проєкту.

Весь сеанс роботи, що включав дослідження репозиторію, планування, написання коду, рев'ю та фінальне виправлення, коштував автору лише $0,265 (менше 27 центів).

Новини від OpenAI.

GPT-5.5-Cyber і ініціатива Daybreak
https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
Анонсували реліз моделі GPT-5.5-Cyber у рамках ініціативи Daybreak. Модель заточена під захисну безпеку: пошук вразливостей, threat modeling, генерація патчів для кодових баз. На бенчмарку CyberGym вона набрала 85.6% — більше за базовий GPT-5.5 (81.8%) і Anthropic Mythos 5 (83.8%). Наразі доступ — лише для верифікованих організацій.

Codex: скидання rate-limit
https://community.openai.com/t/flexible-rate-limit-resets-for-codex-and-a-method-to-get-a-reset/1383470
Головна зміна червня 2026 — banked rate-limit resets. Механізм: якщо протягом 5-годинного вікна не вибрати увесь ліміт — залишок «банкується» і зберігається як окремий reset, який можна використати пізніше. Це не API-кредити і не гроші на балансі — виключно додатковий ліміт у межах підписки ChatGPT. Він діє 30 днів від моменту нарахування.

Кожен користувач Plus/Pro отримав один безкоштовний reset, ще до трьох можна заробити рефералами до 24 червня. У деяких не з'являлися до першого рефералу. Активувати банкований reset можна через Codex desktop app у розділі Settings → Usage remaining. Є нюанс: (деякі Linux і) CLI-користувачі та VSCode-плагін-користувачі поки не мають нативного способу це зробити — тільки десктопний застосунок. У спільноті вже з'явились неофіційні скрипти для CLI-обходу.

Також з'явився екран Codex Profile — там видно usage stats і графіки активності токенів, що особливо корисно з переходом на токенний білінг.

Codex-Maxxing — гайд для довгих сесій
https://openai.com/index/codex-maxxing-long-running-work/
OpenAI опублікувала PDF офіційний гайд / white paper Codex-Maxxing. Це методичка про те, як можна використовувати Codex як постійного робочого агента, який веде довготривалі проєкти, а не просто відповідає на окремі запити. OpenAI бачить майбутнє не в тому, щоб кожного разу починати новий чат.

Термін "Codex-maxxing" тут використовується як назва підходу: не просто задавати питання Codex, а будувати навколо систему роботи:

  • Codex може й має працювати не тільки з кодом. Може керувати як комп'ютером, так і тільки браузером чи мати MCP доступ до пошти/календаря/ітд.
  • замість окремих чатів — постійні потоки роботи (Durable Threads) із накопиченою історією проекту і стиснення контексту (compaction.
  • пам'ять агента повинна бути видимою й відокремленою. Репозиторії зберігають код. Vault (окрема папка) зберігає контекст, рішення, відкрити цикли, поточний стан роботи, тощо.
  • steering — керування під час роботи. Ми не кидаємо завданнях і чекаємо щоб оцінити результат, тепер дивимося що відбувається й в реальному часі дорозповідаємо агенту правки. Взаємодія нагадує роботу з живим співробітником. Дивимося не в чат, а на саму роботу (документи, код) й коментуємо конкретно що де треба по іншому.
  • голос краще за текст + доступ з телефону. OpenAI вважає, що люди текстом часто вводять занадто "відредаговані" запити, а голос дозволяє передати емоції, сирі ідеї, уривки думок які сучасні моделі вже можуть брати до роботи. Ідеш гуляти та розмовляти з агентом з телефону, поки він працює за комп'ютером.
  • використовувати Heartbeats, вони ж Thread Automation — заплановані автоматичні перевірки які дозволяють агенту моніторити стан репозиторію або CI-пайплайну без участі людини. Агент не чекає нового повідомлення від користувача, а сам повертається до задачі за розкладом.

Задачі формулюються через чіткі верифіковані критерії виходу — наприклад, «покрити 100% тестами» або «скоротити час деплою на 30%» — і агент працює автономно до їх досягнення з перевірками. Погана сформульована задача це "Реалізуй весь план", добра це "Перенеси бібліотеку на Rust, збережи API сумісним і вважай задачу завершеною лише тоді, коли всі старі тести проходять успішно."