Как подобрать правильный тарифный уровень OpenAI для ваших ИИ-агентов.

После настройки ИИ агента обычно одной из его задач является понимание намерений звонящего и перевод вызова на соответствующий добавочный номер. Однако есть важные условия – ИИ агент должен иметь доступ к сервису OpenAI и не должен быть ограничен лимитами скорости (rate limits). Если ИИ агент достигнет лимита скорости, звонящий не получит ответа, и поток вызовов прервется. Звонок не будет переведен, и звонящий повесит трубку. Чтобы избежать достижения лимитов скорости, мы подготовили ряд рекомендаций, которых следует придерживаться.

Этот блог – длинное чтение! Вкратце, вот что мы рассматриваем:

  • Типичные сообщения журнала при достижении лимитов скорости
  • Немного математики о том, как можно оценить потребление токенов
    • Техническая сложность звонка и как она влияет на потребление токенов
    • Как источники знаний влияют на потребление токенов
  • Перевод лимитов скорости в одновременные звонки ИИ агента
  • Как ориентироваться в OpenAI, чтобы понять и настроить ваши лимиты скорости
    • Аккаунты OpenAI при оплате от 100$ обычно сразу переводятся на уровень Tier 3.

Сообщения в журнале при достижении лимитов скорости

Когда достигается лимит скорости OpenAI, это можно увидеть в файле 3CXAI.log; вот пример:

2026-03-09 10:17:26.674|DEBUG|{'call': 110, 'dir': 'ai', 'detail': True} [OpenAI] response.done content> :
{'type': 'response.done', 'event_id': 'event_DHYWMxZ4ipQABCDEFGHIJ', 'response':
{'object': 'realtime.response', 'id': 'resp_DHYWMnVTGk1234567890', 'status': 'failed', 'status_details':
{'type': 'failed', 'error':
{'type': 'tokens', 'code': 'rate_limit_exceeded',
'message': 'Rate limit reached for gpt-4o-realtime in organization org-LwDoeGAu4fbAABBCCDDEEFF on tokens per min (TPM): Limit 40000, Used 31222, Requested 14701. Please try again in 8.805s.
Visit https://platform.openai.com/account/rate-limits to learn more.'}},
'output': [], 'conversation_id': 'conv_DHYW8SqVAABBCCDDEEFFG', 'output_modalities': ['audio'], 'max_output_tokens': 'inf', 'audio': {'output': {'format': {'type': 'audio/pcm', 'rate': 24000}, 'voice': 'marin'}},
'usage': {'total_tokens': 0, 'input_tokens': 0, 'output_tokens': 0, 'input_token_details': {'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0, 'cached_tokens': 0, 'cached_tokens_details':
{'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0}}, 'output_token_details': {'text_tokens': 0, 'audio_tokens': 0}}, 'metadata': None}}

 

…который ясно показывает, что:

  • достигнут лимит скорости токенов в минуту (или TPM)
  • ни один запрос не может быть обработан в течение следующих 8.805 секунд

Также можно увидеть проблему математически:

  • текущий лимит скорости для этой учетной записи составляет 40,000 токенов в минуту
  • в течение последней минуты было израсходовано 31,222
  • это оставляет 8,778 доступными для использования
  • сделанный запрос потребовал бы 14,701, что превысило бы доступное количество токенов в пределах одноминутного временного окна

Потребление токенов – примерный математический расчет

Базовый уровень естественного разговора

  • Использование токенов зависит от ряда факторов, включая:
    • язык
    • используемую модель
    • стиль разговора
    • количество произнесенных слов
  • Вот некоторые реальные предположения/средние значения:
    • Естественный разговор обычно ведется со скоростью около 150 слов в минуту
    • Каждый звонок имеет максимальную длительность 7 минут
    • Следовательно, 7-минутный разговор будет состоять примерно из 1,050 слов
  • Общепринятый коэффициент конвертации токенов OpenAI (для английского языка) составляет 1 слово на 1.3 токена
    • 7-минутный разговор потребит 1,365 токенов

Можно оценить естественный разговор в типичные максимальные 1,500 токенов.

Корректировки в зависимости от характера и сложности звонка

  • Если звонящий просто регистрируется или назначает встречу, ИИ агенту нужно очень мало думать.
    • Консервативная оценка составит около 1,000 максимальных токенов за звонок
  • Если звонок представляет собой сбалансированный разговор о работе, или рассмотрение документа, или общий обмен мнениями
    • Это попадает в оценку “Естественного разговора” около 1,500 максимальных токенов за звонок
  • Если звонок плотный и технический, можно сделать вывод, что ИИ агенту нужно больше “думать”:
    • Можно оценить около 2,500 максимальных токенов за звонок

ИИ агенты, использующие источники знаний

Если используются источники знаний с ИИ агентами, также следует учитывать накладные расходы токенов на поиск источников знаний; оцените до 2,000 дополнительных токенов на стоимость поиска.

Общая оценка использования токенов

Основываясь на приведенных выше предположениях и оценках, можно сделать вывод, что технический вызов ИИ с источниками знаний потребит:

  • 2,500 токенов за звонок
  • 2,000 токенов за поиск источников знаний

Если включить буфер безопасности в 500 токенов, ваш звонок потребит 5,000 токенов, или 714 токенов в минуту. Можно округлить это значение до 1,000 токенов в минуту.

Сколько вызовов ИИ агента можно обработать?

Вам нужно вписаться в 2 ограничения:

  • Токенов в минуту (TPM)
  • Запросов в минуту (RPM)

Токенов в минуту

Если вы настроили лимит скорости вашей модели ИИ на 20,000 токенов в минуту, то при 1,000 TPM на звонок ИИ агент может обрабатывать 20 одновременных звонков.

Запросов в минуту

Мы не будем вдаваться в подробности здесь, но имейте в виду, что каждый вызов ИИ может генерировать несколько запросов в минуту. Если вы настраиваете вашу систему на обработку, например, 50 одновременных вызовов ИИ, и типы получаемых вами вызовов обычно генерируют 3 запроса в минуту, то логически вам также потребуется установить ваш RPM как минимум на 150.

Навигация по уровням использования и лимитам OpenAI

Большинство пользователей по умолчанию начинают с бесплатного уровня – поэтому понятно, что можно достичь лимитов скорости. Аккаунтам OpenAI при оплате минимум 100$ обычно напрямую присваивается уровень Tier 3.

openai project

На платформе OpenAI перейдите на панель управления вашим проектом и перейдите на страницу Project -> Limits; под заголовком “Rate limits” нажмите кнопку “Select models”.

openai limits

Прокрутите вниз до “Realtime” Rate limits, где можно настроить ваши лимиты скорости, где:

  • TPM – это ваши максимальные Токены в минуту
  • RPM – это ваши максимальные Запросы в минуту

Скриншот выше для учетной записи, которая находится на уровне Free, и можно видеть, что максимально допустимое значение составляет 40,000 TPM и 3 RPM. Перейдите на страницу Organization -> Limits и отредактируйте ваш бюджет, чтобы перейти на более высокий уровень.

openai budget

Можно нажать на ссылку руководства по лимитам скорости для получения более подробной информации; вот главная таблица Usage tiers:

openai usage tiers

Как только необходимые пороги будут достигнуты, уровень вашего тарифа будет скорректирован автоматически. Перейдите еще раз на страницу Project -> Limits, чтобы повысить ваши лимиты при необходимости.

Форум

Продолжайте общение на нашем выделенном форуме по ИИ. Подпишитесь на нас в X и LinkedIn, чтобы быть в курсе последних новостей и выпусков функций.