Длинные документы и ресёрч
Контекст 1 млн токенов и ответ до 64K; StepFun приводит пример: 950 обращений к веб-страницам в одном действии агента.
BrowseComp 88,7 и DRACO 83,3 — данные StepFun. На DRACO Claude Opus 5 — 87,6.
Агентная модель StepFun: 600 млрд параметров (27 млрд активных), контекст 1 млн токенов, текст, картинки и видео на входе. Открытые веса обещаны на 15 октября — разбираем цифры и честные оговорки.
Step 5 Preview — предварительная версия крупной модели StepFun для длинных агентных задач: исследований, анализа документов, финансов и кода. Это разреженная MoE: сеть огромная (≈600B), но на каждый токен работает лишь малая часть (≈27B).
Сильные стороны — контекст 1 млн токенов, вход в виде текста, картинок и видео, цена токена ниже медианы. Слабые — тяжёлый кодинг, многословность и то, что почти все цифры принадлежат самой StepFun.
step-5-previewПараметры — по документации платформы StepFun и анонсу. Состав каталога в Strelka AI — в приложении.
Каждая ступень — одна цифра с указанием источника. Пятая, янтарная, — единственная независимая оценка интеллекта.
токенов на входе; ответ — до 64 тыс. токенов
документация StepFunразреженная MoE: активна лишь малая часть сети
данные StepFunоколо 4,5% от всей модели — вот почему она быстрее плотной «600B»
данные StepFunмедиана reasoning-моделей по Artificial Analysis — 64,6
независимый замерArtificial Analysis; медиана reasoning-моделей в сопоставимом классе — 24
независимый замерКонтекст и параметры — по документации и анонсу StepFun; скорость и индекс — Artificial Analysis (замер на API StepFun, начало публикации — 18–20 сентября 2026). Медиана — по группе сопоставимых моделей в оценке AA.
Step 5 Preview против Kimi K3, GLM-5.3, GPT-6 Astra и Claude Opus 5. Карточки отсортированы по результату; выключайте лишних соперников кнопками.
Программная инженерия
Бенчмарк самой StepFun: 553 репозитория, 33 языка
Программирование
Агентный кодинг в терминале
Финансовый анализ
Глубокое исследование
Все цифры — данные StepFun в пересказе обзоров (MarkTechPost, eesel, BenchLM); независимо не воспроизведены. Основные тесты StepFun запускала на уровне High, у соперников — Max. Баллы разных тестов между собой не сопоставимы.
Единственный внешний замер на 09.10.2026: интеллект выше медианы, скорость тоже — но модель многословна и догоняет, а не обгоняет.
Независимая сводная оценка. У Step 5 Preview — 44 против медианы 24 у reasoning-моделей в сопоставимом классе. По тому же индексу Kimi K3 и GLM-5.3 — тоже на уровне 44: лидером среди открытых она не стала.
При первой публикации (18.09.2026) модель заняла 25-е место из 200 в рейтинге AA.
Замер Artificial Analysis на API StepFun. Скорость зависит от нагрузки и тарифа — у вас она может отличаться.
Для рассуждающей модели это время включает «думание»: у короткого запроса оно может быть меньше, у сложного — заметно больше.
Относительно медианы сопоставимых моделей по оценке Artificial Analysis. Скидка на кэшированный вход — около 95%.
В цену вывода входит и рассуждение модели — поэтому важна следующая строка.
Столько выходных токенов модель выдала на индексе AA (оценки медианы — 90–92 млн). Частично это съедает выгоду от дешёвого токена.
Восемь типовых задач с честным вердиктом. Это ориентир на основе опубликованных данных, а не приговор: проверяйте на своих промптах.
Контекст 1 млн токенов и ответ до 64K; StepFun приводит пример: 950 обращений к веб-страницам в одном действии агента.
BrowseComp 88,7 и DRACO 83,3 — данные StepFun. На DRACO Claude Opus 5 — 87,6.
FrontierFinance 66,4: выше GPT-6 Astra (55,0), Kimi K3 (62,6) и GLM-5.3 (64,1).
Данные StepFun. Claude Opus 5 — 69,7; Step 5 запускали на High, соперников — на Max.
MCP Atlas 85,6 и Toolathlon-Verified 74,1 — сильные цифры в данных StepFun.
Ранние пользователи сообщали о частых ошибках вызова инструментов. Это не замеры, но проверьте свой сценарий.
DeepSWE v1.1 — 67,7: на уровне Kimi K3 (67,5) и GLM-5.3 (66,9), ниже GPT-6 Astra (74,1) и Claude Opus 5 (74,0).
Данные StepFun. Сложные задачи — см. следующую карточку.
На входе — до 60 изображений за запрос и видео (MP4, рекомендуемая длина — до 5 минут). MMMU-Pro — 76,4 по Artificial Analysis.
На выходе — только текст: картинки и видео модель не создаёт.
Terminal-Bench v4: 33,3 против 57,9 у GPT-6 Astra и 52,3 у Claude Opus 5; GLM-5.3 — 41,9.
Данные StepFun в пересказе eesel. Для тяжёлых агентных задач есть более сильные варианты.
Лучше: Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra
Модель «рассуждающая»: её ответ включает долгий вывод. AA зафиксировала 160 млн выходных токенов на индексе при медиане ≈92 млн.
Для живого чата и поддержки скорость и краткость важнее — смотрите быстрые модели.
Лучше: Claude Haiku 5.5 — по заявлению Anthropic, самая быстрая модель Claude
AA-Omniscience: точность 41,5%, доля галлюцинаций 43,0% (Artificial Analysis).
Юридические, медицинские и финансовые факты всегда сверяйте по первоисточникам.
Восемь параметров из документации StepFun и пример вызова. Переключайте уровень усилия — код обновится.
Параметры — по документации платформы StepFun. API совместим с OpenAI; для Messages API используется output_config.effort. Код — иллюстрация: адрес и ключ берите в документации.
Хроника Step 5 Preview: от первого появления в рейтинге до заявленного открытия весов. Статус каждого шага — отдельной меткой.
Под меткой step-5-preview-b: индекс 44, 99,8 ток/с. Официального анонса ещё не было.
Подтверждено AAStepFun представила Step 5 Preview: платный API и Studio открылись в тот же день.
Подтвержденоstepfun-ai/Step-5-Preview-BF16 создан 20 сентября, в нём только служебный файл: нет весов, карточки модели и лицензии. По данным обзоров на 08–09.10.2026.
Проверено обзорамиДата из материалов StepFun. Лицензия не опубликована; у прежних Flash-моделей StepFun была Apache 2.0, но для Step 5 это не заявлено.
План · не подтвержденоДлинный контекст и многословие лучше проверить самому: возьмите одни и те же запросы и сравните две модели.
Зайдите в app.strelka.ai: без VPN и без зарубежной карты, оплата — российской картой.
Найдите Step 5 Preview в каталоге или возьмите другую топовую модель для сравнения. Состав каталога смотрите в приложении — он меняется.
Скопируйте промпты ниже, засеките время и объём ответа, сравните две модели на одном и том же запросе.
Вот два договора. Составь таблицу расхождений по срокам, оплате и ответственности и укажи, на какой странице что нашёл. [вставьте тексты]
Разбери отчётность за три года: выручка, маржа, долг. Выдели три риска и три вопроса менеджменту. Помечай цифры, в которых не уверен. [вставьте данные]
Собери обзор по теме [тема]: 10 ключевых тезисов, где источники расходятся и что осталось неизвестным. Отмечай, где данных не хватает.
Хорошая новость выглядит убедительнее, когда рядом написаны границы.
Технического отчёта нет, а StepCodeBench — собственный бенчмарк StepFun. Независимы только замеры Artificial Analysis. Основные тесты StepFun запускала на High, соперников — на Max: сравнение не вполне симметрично.
Название, цена и доступность могут измениться, когда суффикс «Preview» уберут. Эндпоинт может быть ограничен по мощности, а на старте — менее стабилен, чем у зрелых моделей.
Модель многословна: 160 млн выходных токенов на индексе AA против ≈92 млн медианы. Рецензенты в обсуждениях пишут, что она «рассуждает слишком долго». Итог зависит от ваших промптов.
Ранние тестеры сообщали об ошибках вызова инструментов, сбоях после ≈340 тыс. токенов контекста и обрезанных ответах. Это анекдотичные сообщения, не измерения, но агентный сценарий стоит проверить заранее.
1 млн токенов заявлен StepFun и виден в AA, но в стороннем конфиге встречалось 350 тыс. токенов. Прежде чем строить продукт на длинном контексте, прогоните свой объём.
Дата 15 октября не подтверждена, репозиторий пуст, лицензии нет. Не планируйте инфраструктуру, пока веса и условия не опубликованы.
AA-Omniscience: точность 41,5% и доля галлюцинаций 43,0%. Сведений о тестах безопасности в найденных материалах нет. Для критичных данных нужна проверка по источникам.
Сравните Step 5 Preview и другие топовые модели на своих задачах. Без VPN и без зарубежной карты.