Главное за минуту
- Модели обгоняют продукты. Черни называет этот разрыв product overhang: модель уже умеет то, что продукт не даёт ей делать.
- Под Opus 5 команда Claude Code удалила больше 80% системного промпта. Модель стала работать лучше, а не хуже.
- Opus 5 переписал рантайм Bun: 100+ тысяч строк Zig на Rust за 11 дней. Постановка задачи уместилась в одну фразу.
- Внутри Anthropic ежедневно крутятся 20-30 «рутин»: однострочные промпты чистят мёртвый код, пишут тесты, сторожат абстракции.
- Практический вывод: описывай результат и критерий готовности, вкладывайся в верификацию и не пиши модели пошаговых инструкций.
01Кто говорит и почему это стоит слушать
Борис Черни придумал и запустил Claude Code внутри Anthropic. Это человек, который в каком-то смысле создал профессию «агентный инжиниринг»: его инструментом сегодня пишется заметная часть кода в индустрии, включая, кстати, и код нашей платформы.
Интересно, что сам Claude Code родился из той же идеи, о которой доклад. В конце 2024 года Sonnet 3.5 уже мог писать целые файлы и фичи, а все продукты вокруг предлагали автокомплит одной строчки или чат, которому нельзя ничего трогать. Claude Code был попыткой снять с модели эти ограничения. Доклад — та же мысль, доведённая до 2026 года.
Оригинал доклада: Y Combinator, июль 2026. Все цитаты ниже — в моём переводе и пересказе.
02Хобблинг: мы стреноживаем собственных лошадей
Hobble по-английски — путы, которыми стреноживают лошадь, чтобы она далеко не ушла. Черни говорит, что мы делаем то же самое с моделями: обвешиваем их инструкциями, правилами, жёсткими пайплайнами и интерфейсами, спроектированными под слабые модели прошлого года.
Разрыв между тем, что модель умеет, и тем, что продукт ей разрешает, он называет product overhang. И утверждает, что прямо сейчас это самый большой нереализованный ресурс в индустрии: интеллект уже оплачен и загружен, но заперт продуктовыми решениями вчерашнего дня.
Самый высокорычажный ход, доступный разработчику сегодня: уйти у модели с дороги. мысль доклада в моём пересказе
03Они удалили 80% системного промпта. Модель стала умнее
Самый контринтуитивный кейс доклада. Когда вышел Opus 5, команда Claude Code снесла системный промпт целиком, посмотрела, где модель реально спотыкается, и возвращала инструкции по одной строке — только после повторных фейлов на конкретной проблеме.
Итог: больше 80% старого промпта оказалось лишним. По словам Черни, без этих инструкций модель работает даже немного лучше — каждую строчку обвязки она вынуждена тащить в контексте при каждом запуске.
Демка условная, но методика настоящая: удалить всё → смотреть на фейлы → возвращать по строчке. У команды даже есть внутренний режим CLAUDE_CODE_SIMPLE=1, который вырубает вообще все системные промпты. Его гоняют как калибровку: проверить, сколько интеллекта душит обвязка.
Мне тут видится продуктовая версия «горького урока» Саттона: методы, опирающиеся на человеческие эвристики, в итоге проигрывают методам, опирающимся на масштаб вычислений. Системный промпт на три экрана и есть такая эвристика. Только теперь урок добрался с уровня алгоритмов на уровень продукта.
04Кейс Bun: одна фраза, тысячи агентов, 11 дней
Проверка тезиса на живом проекте. Opus 5 получил задачу переписать рантайм Bun с языка Zig на Rust. Без плана, без промежуточных майлстоунов, без пошагового ТЗ.
Ключ не в том, что модель «очень умная». Ключ в верификации: агенты гоняли собственный код против тестсьюта Bun, чинили фейлы и не останавливались, пока всё не прошло. Человек в этом цикле не участвовал.
Черни при этом честный спикер, и это подкупает. Параллельный эксперимент — переписывание Electron-приложения на Swift с попиксельным сравнением интерфейса в виртуалке — на момент доклада шёл уже третью неделю и закончен не был.
Electron → Swift, критерий: пиксель-в-пиксель. 14+ дней, агент шлёт апдейты в Slack. Визуальная верификация UI, глубокий системный код и распределёнка — три области, где, по признанию Черни, «кодинг ещё не решён». Его формулировка: «кодинг решён для такого кодинга, каким занимаюсь я. не для всех».
0520-30 рутин в день: скучная магия
Кейс, который лично мне кажется важнее эффектного Bun. Anthropic держит на своих кодовых базах 20-30 ежедневных автономных рутин. Каждая — одно предложение текста плюс автоматическая проверка результата.
Экономика простая: стоимость добавления ещё одной рутины стремится к нулю, а суммарно они делают работу, на которую раньше уходили десятки инженерных часов. Ровно поэтому «скучные» применения агентов сейчас недооценены сильнее всего.
06Это не история одного вендора. Это тренд с графиком
Понятно, что Черни продаёт свой продукт. Поэтому я пошёл смотреть независимые данные, и они его тезис скорее усиливают.
Лаборатория METR меряет «горизонт задач»: насколько длинную (в человеко-часах) задачу модель закрывает с вероятностью 50%. С 2019 года этот горизонт удваивается примерно каждые 7 месяцев, а с 2024-го быстрее — каждые 3-4 месяца. В январе 2026 они оценивали горизонт Opus 4.5 в пять с лишним часов, и на подходе оценки для поколения Opus 5.
Какую задачу модель закрывает с вероятностью 50%
горизонт задач по оценкам METR, логарифмическая шкала
Точки: оценки METR (Time Horizon 1.1, январь 2026) и AI Digest; ранние модели по первой версии исследования, округлено. Вилки оценок широкие: у Opus 4.5 верхняя граница в 2,3 раза выше точечной. Последняя точка — оценка для фронтира середины 2026 года.
данные таблицей
| модель | когда | горизонт |
|---|
Отдельно забавная деталь. Сам термин unhobbling ввёл Леопольд Ашенбреннер в «Situational Awareness» в 2024 году, но с обратным знаком: он называл так добавление моделям лесов, RLHF, chain-of-thought, тулзов, чтобы раскрыть скрытые способности. Черни через два года говорит: теперь леса сами стали путами.
07Что с этим делать: три правила
Если сжать практическую часть доклада, получается три привычки. Все три противоречат тому, как большинство из нас привыкло работать с ИИ.
Описывай результат, а не шаги
«Сделай X, потом Y, потом Z» осталось в эпохе слабых моделей. Рабочая формула сейчас: задача, границы, критерий готовности. Дальше модель сама. Универсального мегапромпта, кстати, не существует — Черни говорит об этом прямо.
Вкладывайся в верификацию, а не в промпты
Bun переписался не потому, что промпт был гениальный, а потому что модель могла сама гонять тесты. Без автоматической проверки бутылочным горлышком становишься ты, и вся автономия схлопывается. Инженерное время сейчас выгоднее тратить на тесты и измеримые критерии, чем на шлифовку инструкций.
Встречай новую модель как нового сотрудника
«Забудьте всё, что вы выучили о прошлых моделях» — почти дословный совет из доклада. Каждое поколение — отдельный характер и отдельные возможности. Работа с ИИ из теоретической дисциплины превратилась в эмпирическую: попробуй, посмотри, где спотыкается, скорректируй.
Что я забрал себе
Я в этот доклад полез не случайно. У нас на платформе heg.ai крутятся десятки агентов, и я регулярно ловлю себя на том же грехе: пишу модели инструкцию на три абзаца там, где хватило бы задачи и критерия готовности. Привычка перестраховываться обновляется медленнее, чем модели.
Вопрос, который я забрал из доклада и который, кажется, стоит задавать себе регулярно: какие задачи я до сих пор не отдаю ИИ, потому что когда-то решил, что он не справится? Этот список протухает каждые несколько месяцев — ровно с той скоростью, с которой METR перерисовывает свой график.
Разбор подготовлен с помощью ИИ-агента и отредактирован вручную · цитаты в переводе и пересказе.
Источники
- Boris Cherny. Stop Hobbling Your AIY Combinator, видео, июль 2026
- METR. Time Horizon 1.1январь 2026
- METR. Measuring AI Ability to Complete Long Tasksмарт 2025
- Leopold Aschenbrenner. Situational Awarenessиюнь 2024, термин unhobbling
- Richard Sutton. The Bitter Lesson2019
- Разбор доклада в StartupHubсверка фактов
