CodeWithLLM-Updates
-

Open-source skills контролю ШІ
https://github.com/mattpocock/skills
Ці Skills перетворюють AI з «помічника-імпровізатора» на керований інструмент інженерного процесу. Вирішує реальні болі роботи з AI: зменшує хаос і галюцинації, економить токени, масштабується та підвищує передбачуваність. LLM швидко «тупішає» через деградацію уваги на великих сесіях, тому роботу пропонує свідомо дробити, зберігати що вже розуміємо і передавати контекст через документи, а не тримати все в одній довгій сесії.

Передає знання через CONTEXT.md і ADR — агент і команда говорять однією мовою. Треба запускати skills вручну (це свідомий дизайн), та вкласти час на налаштування. Найкраще працює з сильними моделями + хорошим agent harness (Claude Code тощо). Найбільший виграш — на середніх і великих задачах, де важливі якість, відтворюваність і контроль над контекстом.

Відео від Matt Pocock це практичний туторіал по його популярному open-source репозиторію skills. Він показує повний цикл роботи з AI-агентами (Claude Code та іншими) для реальної інженерії.

https://www.youtube.com/watch?v=M6mYodf0dJM

Показує встановлення та налаштування репозиторію (/setup-matt-pocock-skills) — вибір issue tracker (GitHub, Linear, локальні markdown-файли тощо), triage-лейблів і domain-документації (CONTEXT.md + ADR).

Основний workflow:

  • Ask Matt — роутер, який підказує, з чого почати.
  • Grill with docs — глибоке інтерв’ю агента, яке уточнює ідею, досліджує код і оновлює domain-документацію.
  • To-spec — стиснення розмови в детальний spec (problem statement, user stories, implementation/testing decisions).
  • To-tickets — розбиття spec на вертикальні «tracer-bullet» тікети (кожен вміщається в «smart zone» контексту ~100–140k токенів).
  • Implement + code-review — реалізація з TDD-елементами та перевіркою.

Демонструє через рефакторинг / прибирання legacy-коду. Grill with docs → агент досліджує namespace, задає 6–20 питань → shared plan → to-spec → to-tickets чи implement, якщо вміщається в smart zone.

Вже декілька місяців нові моделі вже можуть працювати годинами самостійно й генерувати доволі складні проекти.

ШІ спалює грощі
https://www.tomshardware.com/tech-industry/artificial-intelligence/amazon-accidentally-spent-usd1-8-million-using-claude-for-menial-coding-task-went-860-percent-over-budget-catastrophically-expensive-coding-blunders-discovered-in-internal-amazon-ai-usage-metrics
Amazon випадково витратив $1.8 млн на Claude Sonnet для простого завдання (зіставлення авторів з товарами). Бюджет перевищили на 860%, помилку помітили лише через 5 місяців, проєкт так і не запустили. Й такий баг, що раніше коштував би копійки, тепер спалює сотні тисяч доларів через token-based тарифікацію. Звісно за це ніхто грощі не повертає - багатіють провайдери, які в своїх рекламах спокушають запускати все більше агентів.

Програми надалі стають гіршими
https://ptrchm.com/posts/nothing-works-and-everyone-is-euphoric/
Автор іронічно описує нинішню хвилю захоплення ШІ як своєрідний масовий психоз. Нам постійно обіцяють, що штучний інтелект радикально підвищить продуктивність, автоматизує програмування і зробить програмне забезпечення якіснішим. Але якщо створення коду майже вирішене, то чому програми навколо нас продовжують ставати гіршими?

Оновлення викликають страх, інтерфейси деградують, баги множаться - банківський застосунок, який постійно вимагає повторної авторизації; Slack, що краде фокус вікна; сайт LG, де форма гарантійного звернення ламається в самому кінці; мультимедійна система автомобіля, яка після оновлення стала ще менш надійною та навіть заважає безпечному керуванню.

Проблема не в нестачі інструментів. Команди, які створюють ці великі продукти, майже напевно мають доступ до найсучасніших моделей ШІ. Текст не є анти-ШІ маніфестом. Навпаки, автор вважає, що ШІ дає розробникам надзвичайні можливості - маленькі команди отримують шанс створювати якісні, прості та надійні продукти, які раніше були їм не під силу.

Обговорення
https://news.ycombinator.com/item?id=49033004
Велика дискусія на HN під 700 коментарів. Люди масово підтверджують: оновлення софту тепер викликають тривогу, а не радість. ШІ не зробив масові програм кращими — він просто прискорив виробництво посереднього коду та безвідповідальність (це ШІ згенерував, а не ми).

Розрив тести/реальність
https://www.devopsdigest.com/are-ai-coding-tools-hitting-a-ceiling
BlueOptima провела дослідження BARE (AI Refactoring Evaluation) — тестувала 57 моделей на реальних задачах покращення maintainability (рефакторинг production-коду, зменшення складності, покращення структури без зміни поведінки).

Висновок. Моделі надалі все краще проходять синтаксичні перевірки коду (> 80%), але майже не вміють робити зміни, які реально покращують підтримуваність коду. Також є цікавий висновок про плато: останні релізи frontier-моделей майже не покращують результати на цих задачах (застрягли в діапазоні 17–23%).

ШІ робить прототипи
https://weeraman.com/the-prototype-isnt-the-product/
https://news.ycombinator.com/item?id=49132130
ШІ чудово робить швидкі прототипи, але прототип ≠ продукт. Сама відстань від «працює на ноутбуці» до масової production-ready системи майже не скоротилася: архітектура, масштабування, обробка помилок, безпека, підтримка — усе це вимагає інженерного судження відповідальних людей. Без глибокого розуміння коду ШІ-згенерований проект не зможе вийти зі стадії прототипу в стабільний продукт.

Нові анонсі моделей якраз фокусуються на тому, що код на виході стає все краще, без багів та помилок - звісно тоді модель все довше може генерувати все більше коду, який проходить всі перевірки. Але чи стає у цих моделей краще розуміння самої роботи програміста?

Google посилив лінійку Flash, DeepSeek випустив офіційний V4 Flash з помітно кращими агентними здібностями, Meta зайшла в код-агенти з Muse, Alibaba оновила Qwen Max

Оновлення Gemini 3.6 Flash, 3.5 Flash Cyber
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Тепер є Gemini 3.5 Flash Cyber це спеціалізована модель для кібербезпеки (пошук, валідація та патчинг вразливостей) та вона доступна обмежено для урядів і довірених партнерів. Повна Gemini 3.5 Pro ще закрито тестується.

А ось Gemini 3.6 Flash тепер основна «робоча» модель. Краще генерує код (іноді краще ніж Gemini 3.1 Pro), працює з мультимодальними задачами, при цьому витрачає на 17% менше output-токенів (Artificial Analysis), а на деяких бенчмарках (наприклад DeepSWE) економія сягає 65%.

DeepSeek V4 Flash 0731
https://api-docs.deepseek.com/updates/#date-2026-07-31
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://arcprize.org/results/deepseek-v4-flash-0731
Офіційний реліз (замість preview) моделі з 284–304B параметрів (13B активних) та 1M контекстом вікном від DeepSeek - зараз у публічній бета на API. Ваги відкриті (MIT). Як й у Google з значно покращені агентні здібності й Flash тепер обходить власний V4-Pro Preview на більшості агентних бенчмарків, незважаючи на менший розмір та ціну.

Обіцяють й оновлення DeepSeek-V4-Pro. Модель адаптована під Codex і Responses API, але зараз можно налаштувати тільки deepseek-v4-flash - підтримка deepseek-v4-pro очікується теж найближчим часом. Компанія анонсувала підвищення цін на API (зараз вони надто низькі), але сама модель залишається відкритою для завантаження.

Обговорення
https://news.ycombinator.com/item?id=49214008
Люди обговорюють, наскільки модель дешева плюс достатньо розумна, що відкриває нові сценарії використання, які раніше були дорогими. Хтось уже ганяє на орендованих GPU (RTX 6000, MI300X тощо). Один користувач з 5–6 активними сесіями (фактично 12 потоків) витрачає менше $5 на день.

DeepSeek-центрованний ШІ агент
https://reasonix.io/
https://github.com/esengine/deepseek-reasonix
Локальний агент (один Go-бінарник без залежностей, MIT), оптимізований саме під DeepSeek з cache-first loop. Проект робить фокус на можливості доручити Reasonix довгі автономні завдання і при цьому не втратити контроль. Працювати з ним можна в терміналі, десктопному застосунку, браузері чи прямо в редакторі через ACP, і всі сесії спільні.

Reasonix спершу показує план роботи, а потім на кожному кроці питає дозволу на читання, запис чи виконання команд. Кожен «хід» зберігається як контрольна точка поза git, тож навіть після кількох годин роботи можна скасувати будь-яку зміну, не зачіпаючи історію комітів. Агента легко розширювати через MCP-сервери та власні навички.

Muse Spark 1.2 та Code
https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
https://dev.meta.ai/
Meta теж входить в простір код-асистентів. Muse Spark 1.2 це оновлення моделі, спеціально дотреноване на кодінг та використання власної харнес Muse Code. Покращення в генерації коду, debugging, розумінні великих репозиторіїв і long-horizon задачах.

Muse Code поки у beta, це термінальний код-агент (macOS/Linux, Windows поки немає). Підтримує асинхронні фонові агенти, режим планування (/plan, /grill, /goal), постійні субагенти та журнал подій (event-log) для безпечного перезапуску довгих сесій. Модель доступна в Muse Code і Meta Model API (є дешевший contributor-tier з використанням даних).

https://www.youtube.com/watch?v=c-V4MrY03Mc

Автор https://aicodingdaily.com/leaderboard протестував Muse Spark 1.2 на 15 кодинг-промптах (5 промптів × 3 проєкти: Flutter/Dart, синхронізація даних з мобільного додатку в API, імпорт CSV на PHP). Не через Muse Code, а через Open Code та OpenRouter, з вимірюванням швидкості та реальної вартості. Модель досить повільна й доволі дорога для таких результатів. Каже, що за такі гроші вже є значно кращі варіанти: DeepSeek V4 Flash навіть після підвищення цін, Grok 4.5 тощо.

Qwen 3.8 Max
https://artificialanalysis.ai/models/qwen3-8-max
Нова flagship-модель від Alibaba (2.4T MoE). На Artificial Analysis Intelligence Index спочатку показувала топ-результати (1–2 місце), після оновлення методики тестування опустилася на 9 місце, нижче за Kimi K3. Модель досить «балакуча» (багато токенів). Обіцяють відкриття вагів найближчим часом.

Тут є тонкощі, що таку велику відкриту модель звичайним людям не запустити локально, тому багато хто зараз на невеликих Qwen 3.5 та Qwen 3.6.

Тиждень міні-апдейтів: Grok 4.6, Gemini 3.7 Flash, DeepSeek V4-Pro 0813, GLM-5.3, Qwen 3.8 27B, MAI-Code 1.1 Flash і Muse Glimmer — всі підтягнули генерацію коду без зміни архітектури.

Grok 4.6
https://x.ai/news/grok-4-6
xAI випустила 12 серпня чисто post-training оновлення на тому ж ≈1.5T базі, що й Grok 4.5. З точки зору генерації коду це 1 публічний результат на FrontierCode v1.1 Extended (61.3%), APEX-SWE 56.4%, CursorBench v3.2 підріс з 66.7% до 69.9%. Головне покращення — модель більше самостійно тестує й перевіряє свій код у довгих агентних сесіях, тож витрачає значно менше марних кроків (≈53 ходи проти ≈103 у Claude Opus 5).

Слабке місце як і раніше — робота в терміналі (Terminal-Bench 3.0 лише 26%). Елон пише що Grok 4.7 вже за декілька тижнів. Оновлення потрохи рухають модель все вище у рейтингу artificialanalysis й наближують до найкращіх.

DeepSeek V4-Pro 0813
https://api-docs.deepseek.com/updates/
13 серпня Pro-рівень нарешті отримав той самий агентний post-training, що вже був у V4-Flash 0731 — і це вже повноцінний production-реліз, а не preview. Операційно додали підтримку OpenAI Responses API, нарешті one-click налаштування Codex і керування рівнем reasoning (low/high/max). Ваги для 0813 не публікували.

Gemini 3.7 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Google 13 серпня, за три тижні після 3.6 Flash. Найбільший стрибок усієї Flash-лінійки саме в кодінгу: DeepSWE v1.1 з 49.0% до 65.3% (якщо вірити тестам), FrontierCode 1.1 Main з 34.4% до 43.6% а в таблиці Google це краще за Claude Sonnet 5 і GPT-5.6 Terra - оце так. Додатково майже вдвічі дешевша на старті ($0.75/$3.75 за M токенів до кінця 2026), контекст 1M.

GLM-5.3
https://z.ai/blog/glm-5.3
Z.ai 14 серпня, та сама 743B база, що й GLM-5.2, всі здобутки — з post-training (IndexShare + SAO). Код: +50% на внутрішньому Z.ai Code Bench, Terminal-Bench 3.0 28.3% (найкращий показник серед open-weights, для порівняння GLM-5.2 мав 4.6%), DeepSWE 1.1 66.9%. Говорять, що кіберспроможність (CyberGym 84.5%, ExploitBench з 24.4% до 54.4%) настільки зросла, що випуск вагів затримали на два тижні для safety-перевірки. Поки лише GLM Coding Plan та ZCode.


Qwen 3.8 27B
https://huggingface.co/Qwen/Qwen3.8-27B
Alibaba 14 серпня, щільна (dense) мультимодальна 27B-модель під Apache 2.0 — дистиляція флагманського Qwen3.8 Max для локального запуску. Все тести показують помітний ріст над Qwen3.6-27B, чого ми й чекали. Рідний контекст 262K (розширюється до 1M через YaRN), тягнеться на звичайних топових GPU та Ryzen AI Max.

MAI-Code 1.1 Flash
https://microsoft.ai/models/mai-code-1-flash/
https://github.blog/changelog/2026-08-11-mai-code-1-1-flash-available-in-github-copilot/
Microsoft 11 серпня оновила свою невелику код-модель (MoE з ≈5B активних) і запустила в GitHub Copilot. Оновлення зроблене під реальні скарги розробників, тому дотягнули +22% на Terminal-Bench 2.1 і +15% на .NET, плюс native vision (розуміє скріншоти й діаграми). Для рутинних легких задач стало важливішим інше: на 25% ефективніша за токенами і вчетверо дешевша (на 73% нижчий список, ніж у 1.0) — тренована з нуля на чистому enterprise-датасеті без дистиляції.

Muse Glimmer
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
Meta 10 серпня вперше за 16 місяців (після Llama 4) випустила знову open-weights модель — 30B під Apache 2.0, дистиляція закритого Muse Spark для локального запуску на одній споживчій GPU (4-bit квантування ≈ 17GB VRAM). Для коду лідирує в своєму класі за агентними задачами, але програє Qwen3.6-27B (а там вже 3.8 вийшла). Цікаво, що разом з нею Цукерберг пообіцяв колись відкрити ваги і більш потужної Muse Spark 1.2.

Vercel та Slack теж хочуть бути на ринку кодінг інструментів.

fx — крихітний нативний код-агент
https://fx.sh/
https://github.com/vercel-labs/fx
fx яу відповідь на роздуття агентних TUI від Vercel Labs це поки що експерементальний харнес у CLI на Zig, бінарник 6–8 МБ, старт за мікросекунди, мінімальний системний промпт, UI ближче до Unix-шелла, ніж до «IDE в терміналі». Apache-2.0 ліцензія. Є Wasm-збірка (демо прямо в браузері), skills, MCP, субагенти, ACP для редакторів.

Моделі через Vercel AI Gateway чи підписку Codex (fx login codex) або Grok (fx login grok); за замовчуванням зараз у демо стоїть glm-5.2. Поки v0.0.5, «use at your own risk».

Slack Code: агентний кодинг для команд
https://www.salesforce.com/introducing-slack-code/
Salesforce запускає Slack Code — окремі code канали всередині Slack, де можна тегнути код-агента (Claude, Devin, GitHub Copilot, ChatGPT, агенти Vercel) і разом дивитися дифи, прев’ю та апрувити роботу, не виходячи з чату. Є вкладка Agents і «Add to Slack» для агентів з Lovable, n8n, LangChain тощо. На старті працює з агентами партнерів і доступний на будь-якому плані Slack — але потрібен окремий доступ до кожного агента.

Ідея проста: зараз розмова людини з агентом відбувається в приватній вкладці, команда цього не бачить, контекст губиться. У Slack Code канал створюється під одну задачу, коли непотрібно - архівується, історія лишається як лог. Показують сценарій, де PM сам тегає агента на баг, інженер лише перевіряє диф і дає добро на PR.

Proliferate: open-source IDE для кількох агентів
https://github.com/proliferate-ai/proliferate/releases
https://proliferate.com/
Proliferate це спроба зібрати команду агентів з ізоляцією гілок і спільним рев’ю. Проект open-source (AGPL-3.0), де в одному воркспейсі паралельно крутяться нативні харнеси: Claude Code, Codex, OpenCode, Cursor, Grok. Кожна задача — окремий git worktree (або хмарний sandbox, який живе, коли ноутбук закритий), є субагенти, спільні MCP/skills і beta workflows (нічні рев’ю, triage з CI, бампи залежностей).

jcode під спільну работу агентів
https://jcode.sh/
https://github.com/1jehuang/jcode
https://www.ycombinator.com/companies/jcode
jcode — open-source (MIT) термінальний агент, написаний на Rust, від Jeremy Huang, Y Combinator. Місія проекту розпаралелити десятки задач одночасно. Ключова фішка це наднизьке споживання пам’яті, за вимірами проекту 10.4 MB на додаткову сесію проти 212.7 MB у Claude Code, тобто 10 сесій jcode менше половини одного Claude Code.

TUI при цьому повноцінний з підтримкою зображень, LaTeX/math, діаграми/Mermaid, є live-прогрес фонових-задач, swarm-режим з нотифікаціями про конфлікти файлів і меседжингом між агентами.

Orca від Stably
https://onorca.dev/
https://github.com/stablyai/orca
Orca це окремий open-source ADE (Agent Development Environment, MIT). Це десктоп-IDE для паралельних агентів: кожна задача — окремий git worktree + свій термінал (Ghostty-inspired) + браузер, можна ганяти Claude Code, Codex, OpenCode, Cursor side-by-side, є мобільні компаньйони та Orca CLI.

https://www.youtube.com/watch?v=vZUUHMCBoQg

Практична цінність це Workspace Board для роздачі задач різним агентам та єдиний Diff Review для рев’ю/мерджу без стрибків між гілками, та вбудований Chromium з Design Mode (інспекція DOM → копія розмітки агенту для точкового фіксу верстки), спліти вкладок, інтегрований редактор, автоматизація git-workflow (створення worktree через Cmd+N + setup-скрипт pnpm install, стейджинг/коміти/PR).

Змини в доступних моделях. OpenAI відключає Cursor після його покупки SpaceX.

OpenAI розриває контракт з Cursor!
https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/
https://cursor.com/blog/joining-spacex
14 серпня Cursor (Anysphere) офіційно став частиною SpaceX — all-stock угода на ≈$60 млрд з доступом до GPU-інфраструктури Colossus для тренування. 28 серпня OpenAI повідомила SpaceX, що згортає контракт на постачання своїх моделей у Cursor з датою відключення 12 листопада 2026 — це максимальний notice за їхнім кастомним договором.

Рішення пояснюють недовірою: OpenAI пише, що не може бути впевнена, що SpaceX дотримуватиметься ToS, згадуючи порушення контракту Twitter (тепер частина SpaceX) після купівлі Маском та визнання під присягою цьогоріч, що xAI дистилювала дані OpenAI для тренування. Окремо згадують новий рівень відповідальності для наступної моделі Astra — тому майбутні моделі Cursor не отримає як частину підписки, хоча через власний API-ключ залишається.

Обговорення
https://news.ycombinator.com/item?id=49486172
Колись Cursor цінували саме як обгортку навколо топ моделей OpenAI/Claude, а тепер вона стає майданчиком для розгортання Grok від Маска. Вони заплатили не за IDE, а за мільярди промптів і код-контекстів для тренування. Люди гадають чи забанить Anthropic тепер Cursor. Засновник Cursor у твіті пише, що мовляв моделі OpenAI це лише ≈5% трафіку, але в коментах уточнюють що по revenue це значно більше. Частина розробників шукають куди мігрувати — JetBrains, Zed, OpenCode, Codex, бо втрачати можливість перемикати Sol/Terra для планування + Composer/Claude для реалізації не хочуть.

В OpenCode Zen зник безкоштовний DeepSeek Flash
Користувачі помітили, що в безкоштовному шлюзі OpenCode Zen зник deepseek-v4-flash-free, а якщо була підключена через API то почала видавати помилку "401 No payment method. Add a payment method here" — модель, через яку багато хто (та й я) робив 100% безкоштовний якісний код останні тижні. Офіційного анонсу немає, в issues та на Reddit просто "unavailable". На самому DeepSeek API з 16 серпня там новий peak/off-peak прайсинг (пік 01:00–04:00 та 06:00–10:00 UTC у 2× дорожче, загалом +3.5–4.7×).

GLM-5.3, GLM-5.3 Flash як ox-alpha та Qwen 3.8 Flash
https://z.ai/blog/glm-5.3
https://z.ai/blog/glm-5.3-flash
https://qwen.ai/blog?id=qwen3.8-flash-next
Z.ai 14 серпня випустила GLM-5.3 на тій же 743B базі що GLM-5.2, все за рахунок post-training. А 26 серпня вийшов GLM-5.3 Flash вже на новій базі — MoE 320B total / 18B активних, перший відкритий frontier з гібридним sparse+linear attention (KV-кеш у ≈4.4× менший), нативна мультимодальність (текст+картинка+відео), 1M контекст, MIT. До анонсу його тиждень ганяли анонімно на OpenRouter та в OpenCode Zen як stealth/ox-alpha — став найпопулярнішою моделлю тижня, на рівні Claude Opus 4.8 за ≈1/10 ціни.

Того ж 26 серпня Alibaba викотив Qwen3.8-Flash-Next (в API — Qwen3.8-Flash) — прев'ю архітектури для Qwen4: MoE 125B + 51B N-gram memory + 4B MTP, лише 6B активних, Qwen Sparse Attention на мікро-блоках, gated residual, 262K нативно (тягнеться до 1M), мультимодальність, ліцензія Qwen 1.0.

Voyage Code 4 — ембедінги заточені під агентів
https://blog.voyageai.com/2026/08/13/voyage-code-4/
З грудня 2024 voyage-code-3 був однією з найпопулярніших моделей Voyage взагалі — хітом саме серед код-ембедінгів для RAG і семантичного пошуку, його масово підключили код-асистенти (Cursor, Continue, Cody та інші) як базу для пошуку релевантних файлів і сніпетів. Але зараз більшість запитів роблять уже не люди, а агенти.

Нове покоління лінійки Voyage Code, наступник code-3, перезібраний саме під агентів. На практиці це означає що модель помітно частіше знаходить потрібний файл з першої спроби: на 19 нових агентних бенчмарках (held-out репо, NDCG@10 — чим вище, тим краще знаходить релевантне) вона приблизно на третину краще за найближчих конкурентів Cohere та Gemini і майже в півтора раза краще за OpenAI. При цьому вона гнучка і дешевша.

Офіційне середовище для агентів від DeepSeek на мікроядрі Cordis.

DeepSeek Harness (dsh)
https://github.com/deepseek-ai/deepseek-harness
https://www.deepseek.com/harness/en/
13 серпня разом з релізом DeepSeek-V4-Pro-0813 вийшов офіційний відкритий харнес від DeepSeek — dsh на мікроядрі Cordis. Його спочатку створив розробник Shigma як основу для фреймворку чат-ботів Koishi. Згодом виділили в окремий проект (Cordiverse), а дослідники з Пекінського університету та DeepSeek формалізували його математичну модель у статті про «просторово-часову компонованість». Описали можливість динамічно підключати, оновлювати й вивантажувати плагіни прямо під час роботи програми без її перезапуску.

Архітектура побудована за принципом «усе є плагіном»: цикл роботи агента, інструменти, ізольована пісочниця та інтерфейс користувача реалізовані як окремі модулі зі зворотними ефектами (чистим скасуванням змін) і спільним контекстом. Ліцензія MIT, проект поки на стадії раннього доступу для розробників із можливими змінами в API. У репозиторії є навчальні посібники для створення власних розширень, а спільнота вже публікує додаткові плагіни з тегом dsh-plugin.

https://www.youtube.com/watch?v=RWp5cejTApU

У практичному огляді автор демонструє реальний робочий процес у веб-інтерфейсі dsh. Головні корисні можливості з відео:

  • Вбудований маркетплейс (Harness Market) — встановлення розширень, додаткових інструментів та сторонніх провайдерів моделей прямо з інтерфейсу.
  • Режими роботи (Code, Minimal, Creator) — зокрема режим Creator для налаштування власних пресетів агентів та інспекції стану системи.
  • Керування робочими просторами та живий контроль — організація проєктів за папками, а також можливість ставити виконання на паузу та коригувати цілі на льоту без перезапуску всієї сесії.

Обговорення
https://news.ycombinator.com/item?id=49285244
На Hacker News проект обговорюють насамперед як приклад інженерії агентних систем. Головний висновок розробників — продумане середовище (цикли зворотного зв'язку, контроль контексту та виклики інструментів) зараз дає не менший ефект, ніж оновлення самої моделі.

Також порівнюють з Reasonix (компактний агент на Go, оптимізований під DeepSeek, MIT): Reasonix націлений на максимальну економію завдяки стабільному префіксному кешуванню для довгих сесій (часто менше $1–2 на задачу), тоді як dsh є більш універсальним, розширюваним та офіційним каркасом.