Alibaba Cloud внедрила систему, которая сокращает использование больших языковых моделей при обработке тикетов техподдержки: маршрутизация и решение части запросов без LLM повышает скорость и точность, снижая затраты.
Мнение эксперта
- В России оптимизация AI-инфраструктуры критична из-за ограниченности вычислительных ресурсов и роста цен на GPU, поэтому подобные подходы будут востребованы.
- Интеграторам стоит изучать гибридные схемы, где LLM применяется только для сложных случаев, а рутинные запросы обрабатываются классическими алгоритмами.
- Сокращение вызовов LLM снижает риски ИБ, так как меньше данных покидает контур заказчика.