AI

Редакция Overclock.bg ·

GPT-6 Astra: скок в пространственото мислене

GPT-6 Astra: скок в пространственото мислене

На 12 септември излязоха първите независими измервания на GPT-6 Astra върху задачи, които изискват модел да разбира физическото пространство — и резултатите са необичайно категорични за толкова ранен тест. Още при пускането на модела на 3 септември Perplexity и Cognition обявиха, че вече ползват модела в производствените си системи, а не само в демонстрации.

Поводът е публикация на The Decoder по данни от Йоав Арци, изследовател в Корнел, който описва наблюдаваното като „скок в пространственото мислене“ (step change in spatial reasoning). Формулировката е силна, но данните зад нея са публични и проверими.

Пет задачи с канцеларски материали

Тестът се казва StationeryBench и е нарочно скучен: пет задачи с предмети от бюрото, изпълнявани от двуръки роботи YAM. Отваряне на капачка на маркер, изсипване на кламери в повдигната купа, подаване на линийка от едната ръка в другата, издърпване на средно самозалепващо се листче и изваждане на гума от кутия със затваряне на капака. Всяка задача се повтаря по 20 пъти, оценката е двоична — успех или провал, а стандартният лимит е 120 секунди на епизод.

Срещу Astra стои MolmoAct2 на института Ai2. В публикуваните резултати от общо 200 опита Astra завършва 7 от своите 100 задачи докрай, а MolmoAct2 — нито една. По-показателен е медианният резултат за напредък: 46 от 100 точки за Astra срещу 12 за MolmoAct2, тоест почти четирикратна разлика.

Разбивката по задачи обяснява откъде идва всичко: при отварянето на маркера Astra успява в 5 от 20 опита със среден напредък 62/100, при линийката и листчето — по веднъж от 20, а при кламерите и кутията с гумата не завършва нито един опит, макар да стига до 51 и 34 точки напредък.

Тоест не става дума за модел, който решава задачата. Става дума за модел, който за пръв път системно стига до средата ѝ там, където досегашните се препъват на първата стъпка. Арци предполага, че OpenAI е тренирала върху големи обеми 3D данни — например сцени от Blender — и добавя, че на бенчмарка REMAP Astra достига точност близо до човешката, но „и Astra не се доближава до човека в други сценарии“.

Как изглежда това извън лабораторията

Най-нагледната демонстрация не е от робот. Разработчикът Саймън Уилисън помоли Astra през ChatGPT Work да му намери 5K и 10K маршрути за бягане, които правят примка от дома му, с указанието да ползва OSM данни. Моделът е намерил адреса през Nominatim, свалил е местните пътища и пътеки през Overpass и е сметнал примките локално — резултатът е маршрут от 5,1 км около пристанището, визуализиран като карта и изнесен в GPX и GeoJSON. Цялото нещо е отнело 27 минути.

Уилисън отбелязва и проблема: по-късно моделът не е успял да възпроизведе собствения си Python код заради компактирането на разговора. Резултатът е тук, но пътят до него се губи — неприятно, ако смятате да разчитате на такъв изход в работен процес.

Perplexity и Cognition вече са го пуснали

Perplexity съобщава, че на собствения си бенчмарк WANDR Astra взема 0,682 точки при 11,98 щ.д. на задача (около 10,3 €) — най-високият резултат сред тестваните модели, с 13,5% над Fable 5.1 при 6,1% по-ниска цена и с 27% над Opus 5 при 3,3% по-висока. Компанията описва как ползва модела, за да пише комуникация, да променя софтуер и да наблюдава производствени системи, като го проверява значително по-рядко, отколкото предишните. Astra вече е достъпен в Perplexity Computer за абонатите Pro и Max.

Cognition е заложила на друга роля: Astra да тества работата на агента Devin. На вътрешния бенчмарк FrontierCode 1.1 моделът е на 0,4 точки от Fable 5 при 64% по-ниска цена и изпреварва Fable 5.1, а на собствения тест за тестване поставя нов рекорд. На практика Devin пуска тестовете, записва видео от изпълнението — например игра за iPhone в симулатор — и връща отчет какво е минало и какво не е проверено. Функцията е активна в Devin Desktop и Devin CLI и влиза в модела-микс на Devin Cloud.

Какво липсва в картината

И двата материала са публикувани от OpenAI по партньорски обявления, а най-важното число за тестващ агент — делът на фалшиво преминалите тестове — не е обявено. Няма и данни колко по-малко код реално преглеждат инженерите. StationeryBench е независим, но е с пет задачи и един тип роботи; REMAP също не покрива всичко.

Заключение

Ранните измервания показват реална промяна в способността на модела да разсъждава за предмети в пространството — но 7 успешни от 100 опита е точно това, което е: начало, не решение. Междувременно търговската употреба изпревари изследването, а рисковете от агенти, пуснати в реални системи, вече са познати — от атаките през агенти на OpenAI срещу RubyGems до предпазливостта, с която Алтман говори за листването на компанията. Ако тествате Astra в екип, мерете не точките в бенчмарка, а колко пъти сте се върнали да поправяте след него.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още