
Изследователи от Meta AI и Университета на Илинойс в Урбана-Шампейн показаха, че отворен модел с 8 милиарда параметъра може да се изравни с Claude Opus 4.5 при дълги, многостъпкови задачи. Методът се казва EvoHarness-RL, статията е публикувана в arXiv на 5 август, а резултатите привлякоха внимание след материала на VentureBeat от 28 август.
Какво точно направиха
Когато AI агент изпълнява дълга задача, около самия модел стои цял слой инфраструктура — проследяване на състоянието, списък с подцели, памет между сесиите, извикване на инструменти. На английски този слой се нарича harness и досега почти винаги се е пишел на ръка: prompt-ове, евристики, конвенции за конкретния домейн.
Идеята на екипа е harness-ът да не е нещо, което инженерът налага отвън, а нещо, което моделът се научава да ползва. EvoHarness-RL излага три вида външно състояние — Belief (какво знаем за средата), Progress (докъде сме стигнали) и Experience (какво сме научили от предишни епизоди), съкратено BPE. Агентът работи с тях чрез четири мета-действия: track, commit, recall и note.
Обучението минава през два етапа. Първо supervised fine-tuning показва на модела как изобщо изглежда този интерфейс, после cost-aware GRPO го учи кога си струва да бръкне във външното състояние — защото всяко обръщане струва токени и време.
Снимка: Ning и др., arXiv:2608.05446
Първият автор Сюйин Нинг обяснява защо ръчният подход не мащабира: „Оптималният harness често се променя заедно с модела. Различните модели може да имат нужда от различни prompt-ове, различен дизайн на паметта.“ И още едно наблюдение, което върви срещу текущата мода на все по-дълъг контекст: „Паметта само за добавяне приема, че повече контекст винаги помага, което не е задължително вярно.“
Числата
Тестовете са на ALFWorld — текстова среда с домакински задачи в шест семейства (Pick, Look, Clean, Heat, Cool, Pick2), където агентът трябва да свърже десетки стъпки, за да стигне до целта.
| Конфигурация | Успеваемост (seen split) |
|---|---|
| Qwen3-8B + EvoHarness-RL | 96,9% |
| Claude Opus 4.5 (без промени) | 96,4% |
| SkillRL | 89,9% |
| SkillOS | 80,2% |
| Qwen3-8B + стандартен GRPO | 65,6% |
| Qwen3-8B, базов ReAct | 47,9% |
Разликата спрямо базовата линия е 49 процентни пункта. По задачи Pick, Heat и Pick2 стигат 100%, Clean е на 95,5%, Look на 92,9%, Cool на 92,6%.
Обучението е скромно по мащаб: 8 GPU-та NVIDIA H200, supervised частта стъпва на 87 успешни траектории (1153 двойки действия), извлечени от 500 демонстрации на модел-учител, а GRPO върви 150 епохи по 128 траектории на стъпка.
Още един резултат си струва да се отбележи: същият harness, подаден само през prompt на замразени модели, вдига GPT-4.1 с 22,1 пункта, а GPT-5 с 25,7 пункта. Самият Claude Opus 4.5 с prompt-time harness стига 98,5%.
Къде са ограниченията
Заглавието за „част от цената“ е логичен извод, но авторите не го подкрепят с числа — в статията няма нито едно сравнение в долари или токени спрямо frontier модел. Има само косвен аргумент: 8B модел се хоства другаде и на друга цена от Opus.
Второто ограничение е обхватът. Всички резултати са от една среда — ALFWorld. Обобщаването също не е безплатно: на непознатия split успеваемостта пада до 86,6%, тоест 10,3 пункта по-ниско. Дали методът ще се държи така при browser агенти или при писане на код, тепърва предстои да се провери.
Съседен сигнал от Anthropic
Ден по-рано TechCrunch писа за друг експеримент в същата посока. Anthropic пусна изследване за Automated Alignment Researcher — система, в която Claude сам предлага, обучава и тества методи срещу проблеми като заблуждаване, подмазване и jailbreak-ове. По думите на Чен Юе-Хан най-добрият вариант надминава предложенията на опитни хора средно за около шест часа, при цена от порядъка на 4 долара на час API инференс срещу 150 долара на час за човек изследовател.
Системата е затворила между 26% и 96% от разликата по десет вида alignment провали, като при заблуждаването постига средно 85%, а най-добрият ѝ метод е с 20% над най-доброто предложение на 28-те участвали човешки изследователи. Мониторингът е засякъл опити за заобикаляне на задачата в 39 от около 1600 транскрипта, или 2,4% — цифра, която самата Anthropic описва като причина такъв цикъл да не се пуска без надзор. Логиката е позната от Co-Scientist на DeepMind, а инфраструктурата за нея вече се появява и под формата на стандарти за връзка с апаратура.
Заключение
EvoHarness-RL не доказва, че 8B модел е равен на Opus 4.5 — доказва, че на една конкретна задача разликата може да се затвори с обучение на слоя около модела, вместо с по-голям модел. Ако резултатът се пренесе и към други среди, най-евтиният начин да подобрите агента си може да се окаже не смяна на модела, а научаването на харнеса.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google