У незалежному тестуванні OpenAI GPT-6 Astra виявилася майже не кращою за свою попередницю

11:12, 06.09.2026

OpenAI повідомила про випуск нової моделі штучного інтелекту GPT-6 Astra, заявивши, що це революційна система, а не звичайне оновлення; президент компанії Грег Брокман (Greg Brockman) навіть натякнув на настання ери сильного ШІ (AGI), але незалежне тестування не виявило в ній нічого видатного.

За результатами серії тестів, проведених компанією Artificial Analysis, OpenAI GPT-6 Astra показала результати на одному рівні зі своєю попередницею, гірші за провідні моделі Anthropic і навіть слабші за нещодавно випущену Meta Muse Spark 1.3. Artificial Analysis тестує моделі за єдиною відкритою методологією без участі розробників і формує на основі цих тестів рейтинги: Intelligence Index включає завдання з математики, природничих дисциплін, програмування, аналізу довгих документів та фактичних знань; оцінка Coding Agent Index відображає роботу моделей у відповідних агентських системах Codex, Claude Code або Muse Code. Реєструються обсяги споживання токенів, вартість завдання та швидкість роботи.

У рейтингу Intelligence Index модель OpenAI GPT-6 Astra набрала 61 бал — стільки ж, скільки й попередня GPT-5.6 Sol. Для порівняння: Anthropic Claude Fable 5.1 набрала 66 балів, а Meta Muse Spark 1.3 — 62 бали. У Coding Agent Index нова GPT-6 Astra у середовищі Codex показала 67 балів, виступивши приблизно нарівні з Claude Opus 5 і Fable 5 у Claude Code, а також Muse Spark 1.3 у Muse Code — лідерство зберегла Fable 5.1 у Claude Code з 70 балами. У порівнянні з GPT-5.6 Sol нова GPT-6 Astra подорожчала у 2,5 рази: з $4 до $10 за 1 млн вхідних і з $20 до $50 за 1 млн вихідних токенів; знижка на 90 % за читання з кешу та надбавка на 25 % за запис у кеш залишилися незмінними.

Зростання цін компенсував помітний стрибок в ефективності токенів: GPT-6 Astra генерує приблизно третину від обсягу GPT-5.6 Sol і приблизно п’яту частину від Claude Opus 5. Під час роботи з програмним кодом це означає, що за максимальних зусиль робота з нею обходиться на рівні попередниці, при цьому нова модель виявляється на два пункти вище в рейтингу, а за рівного показника стає вдвічі дешевшою, ніж Claude Fable 5. У Intelligence Index картина виявляється дещо іншою: Astra економить лише 10 % вихідних токенів порівняно з попередницею, лише частково компенсуючи різницю в ціні; у розрахунку на завдання вона виявляється на 75 % дорожчою, ніж Claude Fable 5.

Тест AA-Omniscience показав зниження частоти галюцинацій з 92 % до 51 %. У тесті AA-Briefcase модель GPT-6 Astra стала краще справлятися з об’ємними проєктами, де задіяні тисячі вихідних файлів, і додала близько 80 балів Elo, але за якістю презентацій роботи вона поки що поступається GPT-5.6 Sol. А ось у тесті GDPval-AA v2 на практичні завдання у 44 професіях вона, навпаки, втратила 80 балів Elo. У тесті Humanity’s Last Exam з акцентом на математику, написання коду та гуманітарні дисципліни модель додала шість балів; а також показала зниження на два–три бали в тестах ??-Banking (підтримка клієнтів), SciCode (завдання Python у природничій галузі) та AA-LCR (аналіз великих документів).

Таким чином, нова OpenAI GPT-6 Astra стала ефективнішою у завданнях з написання коду, але поки що не змогла перевершити конкурентів від Anthropic у сфері чистого інтелекту.

Джерело: SmartPhone.ua


Обговорення новини

Коментариев пока никто не оставил. Станьте первым!
:)8-):cry:=-):-D:angry::-[:(:devil:,)
укажите цифры с картинки
 

Попередні новини


купить телефон в Одесі, Україна