
Artificial Analysis обяви на 4 септември версия 4.2 на своя Intelligence Index — най-мащабната промяна в класацията от месеци насам. Поводът е ясен: след старта на GPT-6 Astra индексът показа моделa далеч по-ниско, отколкото го класираха други независими оценки, и част от общността започна да пита дали проблемът не е в самия бенчмарк. В новата версия Astra е втори, а начело остава Claude Fable 5.1.
Какво точно се промени
Най-съществената корекция е в теглата. Делът на частните, непубликувани тестови данни в общата оценка се вдига от 20% на 40%. Идеята е проста — колкото по-малка част от индекса е публична, толкова по-трудно е един модел да бъде трениран специално за нея.
Отпада GPQA-Diamond. Причината не е, че тестът е лош, а че вече е решен — челните модели го изчерпват и той спира да различава каквото и да било между тях.
Артифициал Аналисис са пренаписали и част от инфраструктурата за оценяване при AA-LCR v1.1, GDPval-AA v2 и SciCode, където са открили грешки в скорирането, а Elo скалата е реанкорирана наново за по-голяма стабилност.
„Съзнателно задържахме обновяванията, за да остане индексът стабилен по време на последните големи стартирания на модели. Но при това темпо на фронта смятаме за важно да пуснем незабавно междинно обновяване“, пише екипът в официалното си съобщение.
Двата нови теста
AA-Briefcase е собствена разработка на компанията, изцяло със скрит тестов набор. Проверява не отделни въпроси, а агентна работа по многоседмични проекти със стотици свързани задачи и хиляди входни файлове — тоест нещо, което прилича на реален служител, а не на изпит.
GDP.pdf идва от Surge AI и мери четене на професионални документи: 100 PDF файла от десет области, общо 4592 страници с таблици, графики, бележки под линия и изключения, между които моделът трябва да свърже доказателства.
С тях индексът вече обхваща десет теста: AA-Briefcase, GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1.
Класацията след промяната
Claude Fable 5.1 на Anthropic остава първи. GPT-6 Astra се качва на второ място с четири точки над предшественика си GPT-5.6 Sol, а трети е моделът на Meta.
По отделните тестове картината е по-пъстра. При GDP.pdf OpenAI води убедително — Astra е с 33,2% срещу 28,2% за Sol и 26,2% за Fable 5.1. При AA-Briefcase обаче начело са Fable 5.1 и Opus 5, макар Astra да печели около 85 Elo точки спрямо предишното поколение.
Любопитното е другаде: Astra харчи по-малко токени на задача от почти всеки друг модел близо до фронта. Затова при съотношението цена/резултат Anthropic, OpenAI, Meta и Zhipu AI на практика делят първото място — по-скъпият модел не е непременно по-скъп в употреба.
Откъде тръгна съмнението
Разминаването между оценките беше твърде голямо, за да се подмине. Epoch AI класира Astra на първо място със 169 точки по над 50 бенчмарка, а на ARC-AGI-3 моделът показа сериозен скок. В същото време Intelligence Index го поставяше наравно с предшественика му.
Историята е показателна за състоянието на AI бенчмарковете като цяло. Публичните тестове се насищат бързо, части от тях изтичат в тренировъчните данни, а разликата между два модела все по-често опира до това кой тест сте избрали. Именно затова тежестта на скритите набори расте — и вероятно ще продължи да расте.
Проверката с пеликана
Паралелно Саймън Уилисън пусна своя неформален тест — SVG изображение на пеликан, каращ велосипед. Сравнява Astra на пет нива на разсъждение (от low до max) срещу GPT-5.6 Sol, Terra и Luna.
Снимка: Simon Willison
Изводът му: дори най-ниската настройка на Astra бие всичко от Sol. Цената на Astra е около двойно по-висока — 10 щатски долара за милион входни и 50 за милион изходни токени (приблизително €8,6 и €43) срещу 5 и 30 долара при Sol — но заради по-малкия разход на токени реалната сметка излиза съпоставима.
Какво следва
Версия 5 на индекса се разработва вече осем месеца и ще излиза на етапи; v4.2 е междинна стъпка от нея, извадена по-рано заради темпото на пазара. Ако сте следили спора около обучението на моделите на OpenAI или разширяването на Claude към нови устройства, тази история е от същата серия — индустрията все още няма общ метър за това кой модел е по-добър.
Практическият извод за вас е скучен, но полезен: не гледайте една класация. Разликата между първо и второ място в индекса е няколко точки, а разликата между два теста в същия индекс може да обърне подредбата напълно.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google