Проект OpenWALDO публикует открытый набор данных для обучения ИИ объемом 167 млрд токенов, чтобы бросить вызов проприетарным моделям гигантов, использующим триллионы токенов. Но для реальной конкуренции этого пока недостаточно.
Мнение эксперта
- Открытые датасеты позволяют российским командам создавать собственные ИИ-решения без санкционных ограничений на проприетарное ПО, ускоряя импортозамещение.
- Интеграторам стоит отслеживать OpenWALDO и подобные инициативы — они могут стать основой для кастомных моделей клиентов с прозрачными данными.
- Однако 167 млрд токенов против триллионов у гигантов означает, что полноценная замена пока невозможна, а качество и безопасность этих данных требуют проверки перед production-задачами.