Как подобрать правильный тарифный уровень OpenAI для ваших ИИ-агентов.
После настройки ИИ агента обычно одной из его задач является понимание намерений звонящего и перевод вызова на соответствующий добавочный номер. Однако есть важные условия – ИИ агент должен иметь доступ к сервису OpenAI и не должен быть ограничен лимитами скорости (rate limits). Если ИИ агент достигнет лимита скорости, звонящий не получит ответа, и поток вызовов прервется. Звонок не будет переведен, и звонящий повесит трубку. Чтобы избежать достижения лимитов скорости, мы подготовили ряд рекомендаций, которых следует придерживаться.
Этот блог – длинное чтение! Вкратце, вот что мы рассматриваем:
- Типичные сообщения журнала при достижении лимитов скорости
- Немного математики о том, как можно оценить потребление токенов
- Техническая сложность звонка и как она влияет на потребление токенов
- Как источники знаний влияют на потребление токенов
- Перевод лимитов скорости в одновременные звонки ИИ агента
- Как ориентироваться в OpenAI, чтобы понять и настроить ваши лимиты скорости
- Аккаунты OpenAI при оплате от 100$ обычно сразу переводятся на уровень Tier 3.
Сообщения в журнале при достижении лимитов скорости
Когда достигается лимит скорости OpenAI, это можно увидеть в файле 3CXAI.log; вот пример:
2026-03-09 10:17:26.674|DEBUG|{'call': 110, 'dir': 'ai', 'detail': True} [OpenAI] response.done content> :
{'type': 'response.done', 'event_id': 'event_DHYWMxZ4ipQABCDEFGHIJ', 'response':
{'object': 'realtime.response', 'id': 'resp_DHYWMnVTGk1234567890', 'status': 'failed', 'status_details':
{'type': 'failed', 'error':
{'type': 'tokens', 'code': 'rate_limit_exceeded',
'message': 'Rate limit reached for gpt-4o-realtime in organization org-LwDoeGAu4fbAABBCCDDEEFF on tokens per min (TPM): Limit 40000, Used 31222, Requested 14701. Please try again in 8.805s.
Visit https://platform.openai.com/account/rate-limits to learn more.'}},
'output': [], 'conversation_id': 'conv_DHYW8SqVAABBCCDDEEFFG', 'output_modalities': ['audio'], 'max_output_tokens': 'inf', 'audio': {'output': {'format': {'type': 'audio/pcm', 'rate': 24000}, 'voice': 'marin'}},
'usage': {'total_tokens': 0, 'input_tokens': 0, 'output_tokens': 0, 'input_token_details': {'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0, 'cached_tokens': 0, 'cached_tokens_details':
{'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0}}, 'output_token_details': {'text_tokens': 0, 'audio_tokens': 0}}, 'metadata': None}}
…который ясно показывает, что:
- достигнут лимит скорости токенов в минуту (или TPM)
- ни один запрос не может быть обработан в течение следующих 8.805 секунд
Также можно увидеть проблему математически:
- текущий лимит скорости для этой учетной записи составляет 40,000 токенов в минуту
- в течение последней минуты было израсходовано 31,222
- это оставляет 8,778 доступными для использования
- сделанный запрос потребовал бы 14,701, что превысило бы доступное количество токенов в пределах одноминутного временного окна
Потребление токенов – примерный математический расчет
Базовый уровень естественного разговора
- Использование токенов зависит от ряда факторов, включая:
- язык
- используемую модель
- стиль разговора
- количество произнесенных слов
- Вот некоторые реальные предположения/средние значения:
- Естественный разговор обычно ведется со скоростью около 150 слов в минуту
- Каждый звонок имеет максимальную длительность 7 минут
- Следовательно, 7-минутный разговор будет состоять примерно из 1,050 слов
- Общепринятый коэффициент конвертации токенов OpenAI (для английского языка) составляет 1 слово на 1.3 токена
- 7-минутный разговор потребит 1,365 токенов
Можно оценить естественный разговор в типичные максимальные 1,500 токенов.
Корректировки в зависимости от характера и сложности звонка
- Если звонящий просто регистрируется или назначает встречу, ИИ агенту нужно очень мало думать.
- Консервативная оценка составит около 1,000 максимальных токенов за звонок
- Если звонок представляет собой сбалансированный разговор о работе, или рассмотрение документа, или общий обмен мнениями
- Это попадает в оценку “Естественного разговора” около 1,500 максимальных токенов за звонок
- Если звонок плотный и технический, можно сделать вывод, что ИИ агенту нужно больше “думать”:
- Можно оценить около 2,500 максимальных токенов за звонок
ИИ агенты, использующие источники знаний
Если используются источники знаний с ИИ агентами, также следует учитывать накладные расходы токенов на поиск источников знаний; оцените до 2,000 дополнительных токенов на стоимость поиска.
Общая оценка использования токенов
Основываясь на приведенных выше предположениях и оценках, можно сделать вывод, что технический вызов ИИ с источниками знаний потребит:
- 2,500 токенов за звонок
- 2,000 токенов за поиск источников знаний
Если включить буфер безопасности в 500 токенов, ваш звонок потребит 5,000 токенов, или 714 токенов в минуту. Можно округлить это значение до 1,000 токенов в минуту.
Сколько вызовов ИИ агента можно обработать?
Вам нужно вписаться в 2 ограничения:
- Токенов в минуту (TPM)
- Запросов в минуту (RPM)
Токенов в минуту
Если вы настроили лимит скорости вашей модели ИИ на 20,000 токенов в минуту, то при 1,000 TPM на звонок ИИ агент может обрабатывать 20 одновременных звонков.
Запросов в минуту
Мы не будем вдаваться в подробности здесь, но имейте в виду, что каждый вызов ИИ может генерировать несколько запросов в минуту. Если вы настраиваете вашу систему на обработку, например, 50 одновременных вызовов ИИ, и типы получаемых вами вызовов обычно генерируют 3 запроса в минуту, то логически вам также потребуется установить ваш RPM как минимум на 150.
Навигация по уровням использования и лимитам OpenAI
Большинство пользователей по умолчанию начинают с бесплатного уровня – поэтому понятно, что можно достичь лимитов скорости. Аккаунтам OpenAI при оплате минимум 100$ обычно напрямую присваивается уровень Tier 3.

На платформе OpenAI перейдите на панель управления вашим проектом и перейдите на страницу Project -> Limits; под заголовком “Rate limits” нажмите кнопку “Select models”.

Прокрутите вниз до “Realtime” Rate limits, где можно настроить ваши лимиты скорости, где:
- TPM – это ваши максимальные Токены в минуту
- RPM – это ваши максимальные Запросы в минуту
Скриншот выше для учетной записи, которая находится на уровне Free, и можно видеть, что максимально допустимое значение составляет 40,000 TPM и 3 RPM. Перейдите на страницу Organization -> Limits и отредактируйте ваш бюджет, чтобы перейти на более высокий уровень.

Можно нажать на ссылку руководства по лимитам скорости для получения более подробной информации; вот главная таблица Usage tiers:

Как только необходимые пороги будут достигнуты, уровень вашего тарифа будет скорректирован автоматически. Перейдите еще раз на страницу Project -> Limits, чтобы повысить ваши лимиты при необходимости.
Форум
Продолжайте общение на нашем выделенном форуме по ИИ. Подпишитесь на нас в X и LinkedIn, чтобы быть в курсе последних новостей и выпусков функций.



