SOTA-парад: GPT-6 Astra, Claude Fable 5.1, Muse Spark 1.3, Gemini 3.8 Flash і пост-трейн Qwen 3.8 Max 0902.
Muse Spark 1.3
https://research.meta.ai/blog/introducing-muse-spark-1-3
На їх тестах дуже красиво прям SOTA, а в результатах не сходиться: skill-інструкції губить, замість точкового едіта може переписувати файл цілком, сайти виглядають криво. Все як моделі рік тому. Окремо продовжується дешевий contributor-прайс як демпінг. Meta пише, що попереду open-weights release для Muse Spark.
Gemini 3.8 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Pro немає вже давно, це третій Flash апдейт за шість тижнів, заточений під довгі кодінг сессії агентів (що нам приємно), відразу в API, AI Studio, Antigravity. Дешевий прайс лишили до кінця року. Вміє працювати дрібними ітераціями — «працює старанніше», але саме тому на складному жере більше токенів, сам Google так і пише. Cyber-версія тільки для довірених захисників.
Claude Fable 5.1
https://www.anthropic.com/claude/fable
Покращили до Fable 5.1 (загальнодоступна) + Mythos 5.1 (обмежена). Дорогі, але топ. Кажуть, навчили не звітувати про фейковий успіх і не зрізати кути типу відключити падаючий тест. Довгу автономку менше треба пасти, ревʼю швидше. Писати стала людяніше, але непомітно маркує текст (вотермаркінг), на HN окремо хвалять що пішла шаблонність.
GPT-6 Astra — доводить довге до кінця, але жере ліміт
https://openai.com/index/gpt-6-astra/
На 7 вересня GPT-6 Astra у відкритому доступі лише кілька днів. OpenAI позиціонує її як модель не стільки для "генерувати робочій код", скільки для самостійного проходження всього циклу software engineering. Дуже круті демки ігор, також можливість "взяти під контроль" Blender та Unity чи Godot через керування комп'ютером. Це все довго та дорого, але до результату доводить.
У документації прямо підкреслюється: складне міркування, coding, computer use, research і довгі багатокрокові задачі. Astra може працювати з репозиторієм, запускати програми, бачити результати, виправляти помилки, продовжувати роботу після зміни вимог і, у Codex, навіть ставити запитання асинхронно, не зупиняючи незалежні частини роботи.
Astra має 1 млн токенів, але фактичний доступний context у конкретному Codex environment може бути набагато меншим. Також OpenAI ввела новий механізм збереження контексту: замість звичного постійного compaction старих сесій модель може вести notes між вікнами, причому попередні контекстні вікна залишаються searchable.
У даних Terminal-Bench 4.0 розриву між Astra і Fable 5.1 майже немає. Але саме Astra відчувається більш самостійною й тією що розуміє репозиторій (хоча не завжди). Вже помітне надмірне споживання usage/token budget. На Reddit є кілька повідомлень, де користувачі кажуть, що Astra могла витратити значну частину п'ятигодинного ліміту буквально за одну сесію. У мене в Codex на Plus підписки 5-годинний ліміт зжерла виконуючи просте завдання менше ніж за 15 хвилин, є підозра що вікно це ще прижали.
У звичній на сьогодні моделі роботи програміст є оператором AI: промт → отримав код (діфи) → перевірив → накидав правок. У Astra дедалі реалістичнішим стає інший режим коли програміст задає намір, обмеження та критерії завершеності, після чого модель сама розкручує процес. Головний апгрейд Astra — не в тому, що вона генерує не поламаний код, а в тому, що вона дедалі частіше (але не завжди) здатна довести все завдання до кінця.
#newllmmodel #openai #gpt6 #fable #musespark #gemini #qwen