Модель, которая обходит человека на его собственном рабочем столе
GPT 5.4 — модель OpenAI. На бенчмарке OSWorld, который проверяет управление интерфейсом операционной системы, она впервые в линейке GPT превысила результат эксперта-человека: 75% против 72,4%. В неё же напрямую встроены поглощённые фронтир-кодовые способности GPT-5.3 Codex.
Шесть изменений, которые заметны в работе
Не только более высокий балл на бенчмарках, а конкретные возможности: как модель видит экран, ищет инструменты и объясняет ход мыслей.
Компьютерное управление
Нативный computer use с более точным зрением: детальный режим изображения различает до ~10,24 млн пикселей — заметно точнее наводит курсор на мелкие элементы интерфейса.
Поглощённый Codex
Фронтир-кодовые способности GPT-5.3 Codex перенесены прямо в основную модель — отдельно переключаться на кодовую версию больше не нужно.
Tool Search
Модель ищет нужный инструмент среди подключённых, а не держит описания всех сразу в контексте — по данным OpenAI, это заметно сокращает лишние токены в агентных цепочках с несколькими инструментами.
Interactive Thinking
Модель сначала показывает план рассуждений, а затем позволяет скорректировать его по ходу ответа, не дожидаясь, пока рассуждение закончится полностью.
Меньше фактических ошибок
По данным OpenAI, модель примерно на 33% реже допускает фактические ошибки, чем GPT-5.2, — полезно там, где ответ проверяют не построчно, а целиком.
Экспертные бизнес-задачи
83,0% на GDPval и 87,3% на задачах финансового моделирования для инвестбанкинга — задачи уровня специалиста, а не только код.
Бенчмарки — включая тот, где GPT 5.4 проигрывает
Публичные результаты по данным OpenAI и независимых обзоров (NxCode, The Decoder). Один бенчмарк ниже показывает проигрыш Claude Opus 4.6 — мы не стали его убирать.
На SWE-bench Verified GPT 5.4 уступает Claude Opus 4.6 — мы указываем это прямо в разделе «Честно» ниже, а не только здесь мелким шрифтом.
Что на самом деле значит «обгоняет человека»
Четыре уточнения к заголовочной цифре — чтобы 75% на OSWorld не превратилось в миф о безошибочном ИИ.
Не про отдельные клики
OSWorld проверяет завершение целых сценариев в реальной ОС — открыть приложение, найти файл, изменить настройку и подтвердить результат, — а не точность одного клика.
Выше эксперта — не «идеально»
72,4% — результат подготовленных людей-тестировщиков, а не теоретический максимум. При 75% модель всё ещё не доводит до конца примерно четверть задач бенчмарка.
Скачок за одно поколение
У GPT-5.2 результат был 47,3% — то есть прирост в 28 пунктов за одну версию. OpenAI связывает его с более точным зрением модели и отдельным дообучением на задачах computer use.
Кто проверял
Цифры — из официального анонса OpenAI и независимых обзоров (NxCode, The Decoder). Это не полностью независимый аудит с сырыми логами, как у части других бенчмарков.
Кого она заменила и с кем её путают
У GPT 5.4 в семье GPT есть две честные оговорки — про поглощённую модель и про более новую.
GPT-5.3 Codex
GPT 5.4 — первая основная модель GPT, куда перенесли фронтир-кодовые способности GPT-5.3 Codex напрямую: SWE-Bench Pro выросла с 55,6% до 57,7%, GDPval — с 70,9% до 83,0%. OpenAI поэтапно выводит Codex как отдельную модель из использования. Страница GPT-5.3 Codex остаётся на сайте — если вам нужна именно она.
Страница GPT-5.3 Codex →Не путайте с ChatGPT 5.6
GPT 5.4 вышла 5 марта 2026 года и живёт прежде всего как модель для API, Codex и продвинутых режимов ChatGPT. ChatGPT 5.6 — более новый флагман потребительского приложения. Если нужен именно чат-интерфейс с самыми свежими улучшениями, а не интеграция через API — она подойдёт больше.
Страница ChatGPT 5.6 →Три сценария, где GPT 5.4 на своём месте
Код и агентные цепочки
Поглощённые способности Codex прямо в основной модели, а Tool Search сокращает лишние токены там, где агенту подключено много разных инструментов.
Автоматизация рабочего стола
Нативный computer use пригодится там, где у системы нет нормального API — только интерфейс, по которому раньше приходилось кликать вручную или писать хрупкие скрипты.
Экспертные задачи под ключ
83,0% на GDPval и 87,3% на финансовом моделировании — но результат всё равно стоит проверять, как работу junior-специалиста, а не принимать как готовый вывод.
Сравнение трёх моделей ↓GPT 5.4 можно попробовать совершенно бесплатно
Не нужно сразу оформлять подписку, чтобы понять, подходит ли модель под вашу задачу — проверьте computer use, код или агентную цепочку прямо после регистрации.
Что учесть перед тем, как переходить на неё
Пять вещей, о которых лучше знать заранее, чем выяснить на второй неделе использования.
75% на OSWorld означает, что почти четверть задач модель всё ещё не доводит до конца. Для критичных сценариев автоматизации нужен контроль человека, а не полный автопилот.
На SWE-bench Verified у GPT 5.4 около 80% против 80,8% у Claude Opus 4.6. Разрыв небольшой, но он есть — мы не стали его прятать.
Google предлагает нативный контекст 1 млн токенов без дополнительных надбавок за расширенный режим и в целом дешевле в использовании — если для задачи важнее цена, стоит сравнить.
Если ваши интеграции жёстко завязаны на отдельную кодовую модель, стоит заранее спланировать переход на GPT 5.4 — Codex не будет поддерживаться бессрочно.
Возможность скорректировать план рассуждений по ходу ответа появилась только в этом поколении — поведение и доступность могут измениться в следующих обновлениях.
Промпты, с которых удобно начать
Тебе нужно выполнить последовательность действий в интерфейсе: [опиши шаги]. Перед каждым необратимым действием — удаление, отправка, оплата — остановись и опиши, что собираешься сделать, прежде чем продолжать.
Прочитай кодовую базу целиком, составь план рефакторинга по этапам с оценкой риска и держи существующий набор тестов зелёным на каждом шаге. В конце — список мест для ревью человеком.
У тебя подключено несколько инструментов для этой задачи. Сначала выбери минимально необходимый набор через поиск инструментов, объясни выбор, и только затем приступай к выполнению по шагам.
Подготовь отчёт по [тема] на уровне специалиста-аналитика: структура, ключевые цифры, риски и допущения отдельным списком. Отметь, где тебе не хватило исходных данных для однозначного вывода.
Характеристики
Данные на 15 сентября 2026 года.
- Идентификатор в API
- gpt-5.4 / gpt-5.4-pro
- Разработчик
- OpenAI
- Дата выхода
- 5 марта 2026
- Контекстное окно
- 272 000 токенов, расширенный — до 1 000 000
- Максимальный ответ
- 128 000 токенов
- Компьютерное управление
- нативное, детальный режим изображения
- Tool Search
- поиск инструмента вместо полного списка в контексте
- Interactive Thinking
- корректируемый план рассуждений
- Кодовые способности
- поглощены из GPT-5.3 Codex
- Доступность
- API, Codex, продвинутые режимы ChatGPT
- Доступ из России
- напрямую через Strelka AI, без VPN
- Наследие
- поглотила GPT-5.3 Codex, предшествует ChatGPT 5.6
GPT 5.4, GPT-5.3 Codex или ChatGPT 5.6
Три страницы GPT-семейства на Strelka AI решают разные задачи — вот короткая карта различий.
GPT 5.4
- Компьютерное управление и код в одной модели
- OSWorld 75% — выше эксперта-человека
- Поглотила кодовые способности Codex
- API, Codex, продвинутые режимы ChatGPT
GPT-5.3 Codex
- Отдельная кодовая модель — редактор и терминал
- Поэтапно выводится OpenAI из использования
- Кодовые способности перенесены в GPT 5.4
- Подходит, если интеграция жёстко завязана на неё
ChatGPT 5.6
- Актуальный флагман потребительского приложения
- Вышла позже GPT 5.4
- Для чат-интерфейса, а не API и агентных сценариев
- Свои бенчмарки и своя страница на сайте
Соседние страницы
Вопросы про GPT 5.4
01Что такое GPT 5.4
02Когда вышла GPT 5.4
03Чем GPT 5.4 отличается от GPT-5.3 Codex
04Правда ли что модель обгоняет человека на рабочем столе
05Что такое Tool Search
06Что такое Interactive Thinking
07Какой контекст у GPT 5.4
08Чем GPT 5.4 отличается от ChatGPT 5.6
09Есть ли у модели слабые места
10Можно ли попробовать GPT 5.4 бесплатно
11Нужен ли VPN для доступа к GPT 5.4
12Как получить доступ к GPT 5.4 прямо сейчас
Попробуйте модель, которая ведёт курсор точнее человека
GPT 5.4 и ещё 50+ нейросетей — в одной подписке Strelka AI. Пробный доступ бесплатно, без VPN и зарубежной карты.
Источники
Официальный анонс и факты о computer use, Tool Search и Interactive Thinking — по материалам OpenAI. Бенчмарки, сравнение с GPT-5.3 Codex и хронология релиза — по разбору NxCode и материалу NxCode о переходе с Codex. Дополнительный контекст о выходе модели — по материалам The Decoder и Fortune. Справочные данные — по странице Википедии.