Рассуждающие модели перед ответом продумывают решение: разбивают задачу на шаги, проверяют себя и только потом пишут результат. На задачах, где важен разбор — математика, код, анализ данных, — это заметно поднимает качество. Платой за это становятся скорость и стоимость: размышления тоже состоят из токенов.
На /v1/chat/completions за это отвечает reasoning_effort — со значениями от minimal до high. Параметр работает с моделями любого вендора: по пути он приводится к тому виду, который понимает конечный сервис, и превращается в бюджет токенов на размышления там, где устроено именно так.
В остальных форматах используются их собственные поля:
| Формат | Параметр |
|---|---|
/v1/chat/completions | reasoning_effort |
/v1/responses | Объект reasoning |
/v1/messages | thinking с указанием бюджета в токенах |
Часть моделей рассуждает всегда, без всяких параметров, — тогда включать нечего.
curl "https://api.proxyapi.ru/v1/chat/completions" \ -H "Content-Type: application/json" \ -H "Authorization: Bearer <КЛЮЧ>" \ -d '{ "model": "openai/gpt-5-mini", "messages": [ {"role": "user", "content": "Сколько нулей в конце числа 100!?"} ], "reasoning_effort": "high" }'
Зависит от модели и формата. Одни сервисы возвращают ход размышлений отдельным блоком рядом с ответом, другие показывают только краткую сводку, третьи не показывают ничего. Готовый ответ при этом всегда лежит там же, где обычно, — в choices[0].message.content.
Размышления оплачиваются наравне с ответом: это выходные токены, просто израсходованные до того, как модель начала писать. Их количество приходит в объекте usage отдельной строкой — и часто оно в разы больше, чем сам ответ.
Отсюда практическое правило: чем выше уровень рассуждений, тем дороже запрос. Простые задачи вроде переписывания текста рассуждающей модели не нужны — обычная справится быстрее и дешевле.
- Генерация текста — устройство запроса и ответа.
- Модели — где смотреть, что доступно.
Частые вопросы
Чем рассуждающая модель отличается от обычной?
Перед ответом она тратит часть токенов на разбор задачи: строит шаги решения и проверяет себя. Это помогает в математике, коде и анализе, но увеличивает время ответа и стоимость запроса.
Почему запрос стал дороже, хотя ответ короткий?
Токены размышлений тарифицируются как выходные, а их обычно намного больше, чем текста в ответе. Точное количество видно в объекте usage.
Можно ли увидеть ход размышлений?
Не всегда. Одни сервисы возвращают его отдельным блоком, другие ограничиваются краткой сводкой, третьи не отдают ничего.
Что будет, если передать параметр рассуждений обычной модели?
Решает конечный сервис: он либо проигнорирует параметр, либо ответит ошибкой 400. Поддержку рассуждений у конкретной модели стоит уточнить в каталоге.
Последняя редакция: 2 сентября 2026 г.