Как собрать высокопроизводительный сервер для транскрипции в собственной инфраструктуре.
В текущей IT-экосистеме, определяемой достижениями в области искусственного интеллекта, технологически ориентированные компании все чаще и активнее стремятся к интеграции ИИ в свои процессы. Следовательно, некоторые предпочитают передавать рабочие нагрузки ИИ на аутсорсинг, отправляя данные напрямую в такие организации, как OpenAI, для обработки. С другой
стороны, другим удобнее создавать небольшие мощные системы на собственной площадке для обработки этих рабочих нагрузок.
Данный блог посвящен последнему варианту. Таким образом, рассматривается создание высокопроизводительной установки для расшифровки своими силами, которую в будущем также можно будет использовать для других целей, таких как обучение или настройка моделей.
Звезда данной сборки

Была выбрана видеокарта Asus TUF 5090 32GB OC Edition. Серия Asus TUF выбрана за ее известную надежность и долговечность. Безусловно, даже если бы пришлось выбирать снова, эта карта все равно была бы выбрана вместо вариантов, которые в интернете считаются более быстрыми. Этот вариант стоит около $3900, что значительно меньше, чем у большинства других вариантов, а фактическая разница в скорости для вывода (inference) незначительна. В результате, не стоит тратить дополнительные $500–$1000 ради незначительного увеличения производительности на 1-3%!
Зачем нужен высокопроизводительный ПК с ИИ для 3CX?
Решение 3CX Onboard AI позволяет компаниям запускать ИИ-транскрипцию локально. Следовательно, это значительно повышает конфиденциальность данных и предлагает лучший контроль над вычислительными мощностями. Если бизнесу требуется транскрипция практически в реальном времени и есть много звонков для обработки, потребуется высокоскоростная установка, подобная создаваемой здесь.
Компоненты установки
- Видеокарта: ASUS TUF Gaming GeForce RTX 5090 OC Edition 32GB GDDR7 (Nvidia RTX 5090, PCIe 5.0) – $4140
- Высокоскоростной SSD (ОС/Основной): Samsung 9100 PRO NVMe M.2 4TB (PCIe 5.0, 14800MB/s Read) – $620
- Процессор: Intel® Core™ Ultra 9 Desktop Processor 285K (24 Cores, up to 5.7 GHz) – $568
- Оперативная память: 1 x 48GB (2x24GB) DDR5 6000Mhz Corsair Dominator Titanium RGB Intel XMP (CMP48GX5M2B6000C30) – $1420
- Блок питания: CORSAIR HX1200i (2025) 1200W ATX 3.1 & PCIe 5.1 Compliant (Fully Modular, Platinum) – $259
- Материнская плата: ASUS TUF Gaming Z890-PRO WiFi (Intel LGA 1851, ATX, PCIe 5.0, DDR5, WiFi 7) – $315
- Процессорный кулер: Noctua NH-D15 G2 chromax.black (Premium Dual Tower) – $189
Итого: $7,511
Возможно, при виде этого ценника возникает мысль: “Почему бы просто не купить DGX Spark от Nvidia? Это дешевле.” Однако, такой ход мыслей изначально неверен!
Хотя DGX Spark и подобные решения “все в одном” рекламируются как невероятно быстрые и, по общему признанию, имеют отличный маркетинг, они в 3-6 раз медленнее справляются с расшифровкой вызовов, чем только что собранная установка. Кроме того, DGX Spark и аналогичные решения не имеют выделенной памяти GPU и вместо этого делят оперативную память с остальной системой. Хотя это дает преимущество в виде большего объема памяти, чем обычно, в конечном итоге это снижает скорость.
Снижение характеристик для дополнительной экономии средств
Что касается конкретно этой установки, по общему признанию, некоторое оборудование избыточно. Например, объем оперативной памяти можно снизить до 16 ГБ, так как для задач вывода будет использоваться видеопамять (vRAM) GPU вместо обычной оперативной памяти. Кроме того, чтобы сэкономить еще $100, можно перейти с 9100 PRO NVMe на серию 970-990 PRO от Samsung. Также подойдет менее мощный процессор, например, Core Ultra 5 245K / 250K.
На самом деле, пока установлена видеокарта 5090, характеристики остальных компонентов можно значительно снизить, за исключением, возможно, блока питания. В результате, на снижении характеристик такого сервера можно сэкономить около $1000.
Изображения сборки

На изображении выше показано сравнение Asus TUF 4080 RTX 16GB OC и Asus TUF 5090 RTX 32GB OC рядом друг с другом. Безусловно, обе эти видеокарты весят около 3 кг и почти такого же размера, как предплечье. При планировании покупки высококлассной видеокарты Nvidia серии RTX для собственной сборки, необходимо убедиться, что выбранный корпус действительно подойдет. Как правило, зазоры почти всегда являются проблемой при установке таких высокопроизводительных видеокарт.
Производительность?
Производительность транскрипции на таком сервере может составлять от 32-кратной до 64-кратной скорости живой расшифровки. Следовательно, если имеются записи для расшифровки длиной от 32 до 64 секунд, этот процесс займет около 1-2 секунд, плюс некоторые накладные расходы, связанные со скоростью загрузки модели и другими факторами.
Также не стоит забывать о втором этапе ИИ аналитики полученной транскрипции, который может занять еще несколько секунд в зависимости от ее длины. Данная установка способна обрабатывать контекст объемом от 32 до 64 тысяч токенов, что примерно соответствует 4 часам контекста разговора. Таким образом, даже для самых длинных 3-часовых вызовов в АТС 3CX полный контекст разговора будет учтен при выполнении анализа вызова.
Ниже приведена более подробная информация о тестах производительности из внутренних бенчмарков:

Заключение
Таким образом, была собрана высокопроизводительная рабочая станция с ИИ. Для организаций, использующих АТС 3CX и сервер локальной транскрипции, данная сборка представляет собой вершину мощности локальной обработки. В результате обеспечивается баланс стоимости и гарантия того, что расшифровка вызовов выполняется быстро, точно и надежно сохраняется в пределах локальной сети.
Готовы проверить скорость расшифровки вызовов?



