CodeWithLLM-Updates
-

SOTA-парад: GPT-6 Astra, Claude Fable 5.1, Muse Spark 1.3, Gemini 3.8 Flash і пост-трейн Qwen 3.8 Max 0902.

Muse Spark 1.3
https://research.meta.ai/blog/introducing-muse-spark-1-3
На їх тестах дуже красиво прям SOTA, а в результатах не сходиться: skill-інструкції губить, замість точкового едіта може переписувати файл цілком, сайти виглядають криво. Все як моделі рік тому. Окремо продовжується дешевий contributor-прайс як демпінг. Meta пише, що попереду open-weights release для Muse Spark.

Gemini 3.8 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Pro немає вже давно, це третій Flash апдейт за шість тижнів, заточений під довгі кодінг сессії агентів (що нам приємно), відразу в API, AI Studio, Antigravity. Дешевий прайс лишили до кінця року. Вміє працювати дрібними ітераціями — «працює старанніше», але саме тому на складному жере більше токенів, сам Google так і пише. Cyber-версія тільки для довірених захисників.

Claude Fable 5.1
https://www.anthropic.com/claude/fable
Покращили до Fable 5.1 (загальнодоступна) + Mythos 5.1 (обмежена). Дорогі, але топ. Кажуть, навчили не звітувати про фейковий успіх і не зрізати кути типу відключити падаючий тест. Довгу автономку менше треба пасти, ревʼю швидше. Писати стала людяніше, але непомітно маркує текст (вотермаркінг), на HN окремо хвалять що пішла шаблонність.

GPT-6 Astra — доводить довге до кінця, але жере ліміт
https://openai.com/index/gpt-6-astra/
На 7 вересня GPT-6 Astra у відкритому доступі лише кілька днів. OpenAI позиціонує її як модель не стільки для "генерувати робочій код", скільки для самостійного проходження всього циклу software engineering. Дуже круті демки ігор, також можливість "взяти під контроль" Blender та Unity чи Godot через керування комп'ютером. Це все довго та дорого, але до результату доводить.

У документації прямо підкреслюється: складне міркування, coding, computer use, research і довгі багатокрокові задачі. Astra може працювати з репозиторієм, запускати програми, бачити результати, виправляти помилки, продовжувати роботу після зміни вимог і, у Codex, навіть ставити запитання асинхронно, не зупиняючи незалежні частини роботи.

Astra має 1 млн токенів, але фактичний доступний context у конкретному Codex environment може бути набагато меншим. Також OpenAI ввела новий механізм збереження контексту: замість звичного постійного compaction старих сесій модель може вести notes між вікнами, причому попередні контекстні вікна залишаються searchable.

У даних Terminal-Bench 4.0 розриву між Astra і Fable 5.1 майже немає. Але саме Astra відчувається більш самостійною й тією що розуміє репозиторій (хоча не завжди). Вже помітне надмірне споживання usage/token budget. На Reddit є кілька повідомлень, де користувачі кажуть, що Astra могла витратити значну частину п'ятигодинного ліміту буквально за одну сесію. У мене в Codex на Plus підписки 5-годинний ліміт зжерла виконуючи просте завдання менше ніж за 15 хвилин, є підозра що вікно це ще прижали.

У звичній на сьогодні моделі роботи програміст є оператором AI: промт → отримав код (діфи) → перевірив → накидав правок. У Astra дедалі реалістичнішим стає інший режим коли програміст задає намір, обмеження та критерії завершеності, після чого модель сама розкручує процес. Головний апгрейд Astra — не в тому, що вона генерує не поламаний код, а в тому, що вона дедалі частіше (але не завжди) здатна довести все завдання до кінця.

Схоже, Google вслід за Anthropic намагається обмежити свої моделі за підписним планом лише власним харнесом, ускладнюючи використання цих credentials у сторонніх AI-агентах.

https://news.ycombinator.com/item?id=49548452
Тиждень тому в обговоренні є повідомлення про блокування Google-акаунтів за використання Antigravity через сторонні інструменти. Google прямо називає використання credentials у third-party tool порушенням ToS що може призвести за собою блокування аккаунту. Є окремий коментар користувача, якому заблокували доступ після використання Pi agent + Antigravity.

https://github.com/can1357/oh-my-pi/issues/11689
Вчора у людей в oh-my-pi (OMP) Gemini через Antigravity раптом почав стабільно віддавати 429 RESOURCE_EXHAUSTED і просити почекати 30 хвилин — причому це триває годинами. Це не витрата квоти, а mismatch entitlement — Google ріже agent-бакет для стороннього харнеса під виглядом RESOURCE_EXHAUSTED.

OMP — форк Pi, а OpenClaw теж використовує Pi як основу агентного runtime. Тобто проблема потенційно стосується вже цілої гілки сторонніх агентів.

Cline теж будує нативний Desktop

Найбільший апгрейд Cline
https://cline.bot/blog/how-we-migrated-11-million-users-to-clines-biggest-harness-upgrade
Cline як VSCode екстеншн народився в 2024, це ще при Claude 3.5 Sonnet. Кожна нова модель та провайдер адаптувалися вручну. Новий Cline SDK винесли в окремий модульний рантайм: промпти переписали, луп спростили, контекст і тул-дефінішени підтягнули під нативний tool calling 2026-х моделей замість XML-тегів з тексту. Зараз повністю перевели всіх 11 млн юзерів на нього.

Cline for Desktop (Beta)
https://cline.bot/desktop
https://github.com/cline/cline/releases/
Почали тестувати окремий нативний застосунок на macOS (Universal) і Windows як зараз модно без редактора коду. Всередині той самий open-source Cline harness, що тепер в IDE і CLI. Зібраний на Tauri 2 + Bun-sidecar + Next.js: Tauri тримає тільки вікно й апдейти, Bun-сайдкар крутить Cline Hub і спілкується з UI по websocket, фронт це Next.js.

Працює по BYOK — Anthropic, OpenAI, Gemini, open-weights чи локальний ендпоінт, моделі можна перемикати прямо посеред проєкту. Інтегрований з їх підпискою Cline Pass за $9.99/місяць на open-weights моделі як то GLM 5.3/5.2, Kimi K3/K2.7 Code/K2.6, DeepSeek V4 Pro/Flash, MiniMax M3, MiMo V2.5/Pro, Qwen 3.7-Max/Plus і 3.8-Max.

Вже є queued messages, докидати правки поки агент працює, fork & edit — правиш старе повідомлення і сесія форкається з ревертом воркспейсу до чекпоінта, session history в одному місці — десктоп, CLI, екстеншн і scheduled runs, з фільтром звідки сесія.

В мене на Windows поки що видає купу помилок при налаштуванні моделей й не працює.