Prime Agent от Prime Intellect: ИИ программирует свою память
Команда Prime Intellect представила Prime Agent — принципиально новую обвязку (harness) для ИИ-моделей, которая превращает долгие автономные сессии искусственного интеллекта в отдельную задачу программирования. Релиз уже вызвал большой резонанс: с Prime Agent модель Opus 5 подскочила на бенчмарке ARC-AGI-3 с 30,2% до 95,5%, обойдя базлайн человека-эксперта.
И это опенсорс.
В чём главная идея Prime Agent
Традиционные ИИ-агенты работают с фиксированным контекстным окном: вся история диалога, инструменты и состояние помещаются в один текстовый контекст, который постепенно «раздувается» и деградирует на длинных задачах.
Prime Agent ломает эту парадигму. Его единственный инструмент — постоянное IPython-ядро (persistent IPython kernel). Всё взаимодействие модели с миром происходит через код в REPL-среде.
Prime Intellect формулируют концепцию так:
«RLM рассматривает контекст как переменную, а делегирование субагентам — как вызовы функций внутри REPL».
Это значит, что модель:
- Программно ищет по своей истории — вместо того чтобы держать всё в контексте, она пишет код для поиска нужной информации
- Вызывает инструменты через код — инструменты становятся функциями, а не текстовыми командами
- Запускает постоянных субагентов — как отдельные процессы, работающие параллельно
- Хранит полезное состояние вне активного контекста — в переменных ядра, а не в тексте промпта
Три ключевые идеи в основе Prime Agent
1. Программный вызов инструментов через RLM
RLM (Reasoning Language Model) взаимодействует с инструментами не через текстовые вызовы, а через настоящий Python-код. Это даёт агенту всю мощь языка программирования: циклы, условия, обработку данных, работу с файлами и API — без ограничений текстового формата.
2. Постоянная работа нескольких субагентов
Prime Agent позволяет запускать постоянных субагентов — независимые процессы, которые продолжают работать в фоне. Основная модель делегирует им подзадачи как вызовы функций, а результаты собирает через REPL. Это распределяет когнитивную нагрузку и позволяет решать задачи с долгим горизонтом.
3. Самоизменяемый harness
Пожалуй, самая революционная идея — самоизменяемая обвязка (self-modifying harness). Агент может обновлять собственную память, навыки и настройки прямо во время работы. Он буквально переписывает свои инструменты и подходы по мере накопления опыта — это шаг к системам, которые улучшают сами себя.
Результаты: прорыв на ARC-AGI-3
Prime Intellect сообщают о заметном приросте результатов на задачах с длинным контекстом и долгим горизонтом планирования.
Самый громкий результат — на бенчмарке ARC-AGI-3:
| Конфигурация | Результат на ARC-AGI-3 |
|---|---|
| Opus 5 (стандартная конфигурация) | 30,2% |
| Opus 5 + Prime Agent | 95,5% |
| Human Expert Baseline | 95,4% |
Прирост более чем в 3 раза — и, что важнее, результат превысил заявленный базлайн человека-эксперта (95,4%). Это один из первых случаев, когда ИИ-агент официально обходит человека на ARC-AGI — бенчмарке, который специально создавался как тест на общий интеллект и устойчив к «зазубриванию».
Эмуляторы SEGA и Game Boy — с нуля на Rust
Помимо бенчмарков, Prime Intellect показали впечатляющую демонстрацию: на предварительном (preliminary) бенчмарке Prime Agent с нуля создал рабочие эмуляторы SEGA Genesis и Game Boy Color на языке Rust.
Это не тривиальная задача — написание эмулятора требует:
- Глубокого понимания архитектуры процессоров (Motorola 68000 для Genesis, Sharp LR35902 для Game Boy)
- Точной эмуляции памяти, видео и звука
- Долгого горизонта планирования и десятков итераций отладки
Тот факт, что агент справился с этим автономно, наглядно демонстрирует возможности подхода с самоизменяемым harness и субагентами.
Почему это важно
Prime Agent — это не просто ещё один агентский фреймворк. Это смена парадигмы:
- Контекст как переменная — модель больше не ограничена размером контекстного окна, она управляет памятью программно
- Самоулучшение — агент модифицирует собственные навыки, что приближает к идее рекурсивно самосовершенствующихся систем
- Обход человека-эксперта — результат на ARC-AGI-3 показывает, что правильная обвязка может кардинально усилить существующие модели
- Опенсорс — код открыт, что позволяет всему сообществу воспроизвести и развить подход
Главный вывод: дело не только в модели, но и в обвязке вокруг неё. Одна и та же модель Opus 5 с Prime Agent показывает результаты в разы выше, чем «голая». Это открывает целое направление для исследований.
Ссылки
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru