Базовый хаб по ключевым концепциям machine learning, которые нужны юридическим, compliance и продуктовым командам перед проверкой систем ИИ.
30
Термины
10
Сравнения
8
Вопросы
Основы машинного обучения объясняют, как модели учатся на данных, как разделяются datasets и почему поведение модели зависит от training choices. Эта тема помогает неспециалистам получить достаточный технический контекст, чтобы задавать более точные compliance-вопросы.
Многие юридические и governance-споры возникают из базовых недопониманий о training data, model behavior, validation, bias и generalization.
Полезно для AI literacy, procurement review, model documentation, bias analysis, audit preparation и cross-functional training.
Ключевые подходы, описывающие, как системы учатся на labels, data, feedback или interaction.
Распространённые семейства моделей и алгоритмические строительные блоки, используемые в системах ИИ.
Понятия datasets и training, которые формируют качество модели и governance risk.
Параллельное сравнение обучение с учителем и обучение без учителя. Помогает понять, как обучение из размеченные примеры differs из finding паттерны в данные без заранее заданные метки.
Сравнение reinforcement learning и supervised learning. Разберите, чем обучение на rewards in environment отличается от learning mappings from labeled examples.
Сравнение обучения с учителем и полуобучения. Разберите, чем обучение на размеченных примерах отличается от совместного использования размеченных и неразмеченных данных.
Сравнение self-supervised learning и semi-supervised learning. Разберите, как оба подхода используют неразмеченные данные и почему роль меток различается.
Параллельное сравнение машинное обучение и глубокое обучение. Помогает понять, как более широкий field обучение из данные differs из нейросетевой методы с несколько layers.
Параллельное сравнение обучающие данные и тестовый набор. Помогает понять, почему данные используется для fit модель должна быть separated из reserved данные используется для evaluate it.
Параллельное сравнение обучающие данные и валидационные данные. Помогает понять, как данные используется для fit модель differs из данные используется во время разработка для tune choices и detect generalization problems.
Параллельное сравнение Переобучение и Недообучение. Оно объясняет, чем слишком близкое запоминание обучающих данных отличается от неспособности выучить значимые закономерности в данных.
Параллельное сравнение Classification и Regression. Разбирает, чем прогнозирование дискретных категорий отличается от прогнозирования непрерывных или числовых значений.
Параллельное сравнение Дерево решений и Случайный лес. Помогает понять, чем отличаются термины, когда применяется каждый из них и что это различие означает для AI governance, проектирования систем или доказательств assurance.
Self-supervised learning — это подход machine learning, который создает training signals из самих unlabeled data. Он превращает аспекты unsupervised problem в supervised learning путем генерации surrogate labels, что полезно, когда labeled data мало, а unlabeled data много.
Semi-supervised learning — это подход machine learning, который использует и labeled, и unlabeled data во время обучения. Он полезен, когда labeled examples дороги или ограничены, но большие объемы unlabeled data могут помочь улучшить representation, classification или prediction.
Training data — это dataset, используемый для обучения или fitting machine learning модели путем настройки ее learnable parameters. Его качество, объем, разнообразие, labeling и provenance сильно влияют на performance, reliability и compliance posture итоговой модели.
Overfitting возникает, когда модель слишком точно выучивает training data, включая noise или idiosyncratic details, и плохо работает на новых данных. Обычно он проявляется высокой performance на training data, но более слабой performance на validation или test data.
Underfitting возникает, когда модель слишком проста или недостаточно обучена, чтобы уловить meaningful patterns в данных. Underfit model плохо работает и на training data, и на новых данных, потому что не выучила underlying relationships, необходимые для задачи.
Decision tree — это interpretable supervised learning model, которая представляет decision rules в древовидной структуре. Inference проходит путь от root node через feature-based conditions к leaf node, который дает predicted class или value.
Deep learning — это подраздел machine learning, который использует neural networks с несколькими layers для изучения representations и patterns из данных.
Используйте classification, когда target — это category; используйте regression, когда target — continuous или numerical value.