Корпус — это большая коллекция письменного, устного или иным образом записанного языкового материала, используемого для анализа или обучения модели. Corpora поддерживают такие задачи, как language modeling, translation, information extraction и лингвистические исследования.