Автоматическое определение кодов ТН ВЭД по текстовому описанию товара — практически значимая задача таможенного декларирования, осложнённая многообразием формулировок, неструктурированностью данных и большим числом классов. В работе выполнено сравнительное исследование 5 алгоритмов машинного обучения (Decision Tree, Random Forest, Logistic Regression, LinearSVC, Naive Bayes) на единой стратифицированной выборке из 800000 наименований и 3125 кодов. Все модели обучались и тестировались на одинаковых данных в едином признаковом пространстве TF‑IDF.
Основным критерием качества принято точное совпадение 10-значного кода; дополнительно проведено сравнение по 6 и 4 знакам для анализа ошибок на разных уровнях иерархии. Наилучшую точность полного кода показал LinearSVC (80,75%), на уровне 6 знаков — 85,19%, на уровне 4 знаков — 94,25%.
Выбор моделей обусловлен необходимостью баланса между точностью, вычислительной эффективностью и интерпретируемостью, что критично при масштабировании на миллионы товаров в условиях ограниченных вычислительных ресурсов. В отличие от тяжёлых нейросетевых подходов, предложенное решение не требует дорогостоящей инфраструктуры, может быть развёрнуто на стандартных серверах и обеспечивает приемлемое качество при минимальных затратах на эксплуатацию. Показано, что использование иерархических метрик позволяет глубже анализировать ошибки и может быть рекомендовано для практического применения в системах поддержки принятия решений таможенного инспектора.