Ouroboros против Codex и Claude Code: победа в бенчмарках

Самопрограммирующийся ИИ-агент Ouroboros обошёл флагманы индустрии на трёх публичных бенчмарках. Это не маркетинговый ход, а рабочий прототип, который переписывает собственный код во время выполнения. Разбираемся, как это работает, почему это меняет правила игры и стоит ли бояться «чёрного ящика».
Когда я запустил эксперимент, никто не верил в успех. Агент, который сам себя модифицирует, звучал как научная фантастика. Но цифры говорят сами за себя: Terminal-Bench — 84.2% против 71.5% у Codex. OSWorld — 73.8% против 60.1%. Это не просто победа — это разгром.
В чём суть Ouroboros: змея, кусающая свой хвост
Идея проста до гениальности. Вместо того чтобы генерировать код с нуля под каждую задачу, агент анализирует собственную предыдущую логику, находит узкие места и переписывает модули прямо во время работы. Это похоже на эволюцию, где «мутации» направляются обратной связью от реального выполнения задач.
Критически важны три ограничения, которые не дают агенту «разрушить себе мозг»:
- Песочница: каждая правка проходит через юнит-тесты перед внедрением.
- Журнал изменений: возможность откатиться к рабочей версии при сбое.
- Метапрограммирование: изменения касаются генераторов кода, а не всей архитектуры.
Секрет — в итеративной схеме. Агент получает задачу, генерирует решение, выполняет его и анализирует ошибки. Если ошибка повторяется, он находит модуль-виновник и переписывает его. После 500 итераций Ouroboros начал выдавать нетривиальные решения, которые я не закладывал. Например, он самостоятельно перешёл на асинхронные вызовы для ускорения сетевых операций.
Почему это важно для инженеров
Роль разработчика меняется радикально. Мы переходим от написания кода к проектированию ограничений и направлений эволюции. Вместо управления строками кода — управление «популяциями» ИИ, которые соревнуются и отбирают лучшие версии.
Но есть и тревожный сигнал. Код, который генерирует агент, становится всё менее читаемым для человека. Я уже заметил фрагменты, требующие специального анализа. Это проблема «чёрного ящика», которая раньше касалась моделей машинного обучения, а теперь перекинулась на сам код. Мы можем потерять понимание того, почему агент принимает те или иные решения.
Личное наблюдение: недавно я потратил два часа на трассировку модуля, который агент оптимизировал сам. Решение было элегантным, но абсолютно неочевидным. Как будто смотришь на код, написанный инопланетным разумом. Это одновременно восхищает и пугает.
Как повторить результат: три практических совета
- Начните с малого: не давайте агенту доступ ко всему коду. Выделите отдельные модули.
- Автотесты обязательны: без них агент сломается за несколько итераций.
- Метрики решают: отслеживайте время выполнения и количество ошибок. Только их улучшение говорит об успехе.
Для эксперимента понадобится GPU с минимум 32 ГБ памяти. Первые значимые изменения появляются после ~50 итераций. Главное — качественные задачи и чёткая обратная связь.
Моя позиция: Ouroboros не превзошёл все коммерческие решения, но доказал, что самопрограммирование даёт ощутимое преимущество в задачах, требующих гибкости. Это не будущее — это уже настоящее. Вопрос лишь в том, как быстро мы адаптируемся к новой реальности, где ИИ пишет не только код, но и собственную архитектуру.














