Tanh (гиперболический тангенс)
Definition
Функция гиперболического тангенса (Tanh) — это нелинейная функция активации, широко …
Terms tagged with Deep Learning
Функция гиперболического тангенса (Tanh) — это нелинейная функция активации, широко …
Обучение сходству фокусируется на обучении моделей отображать входные данные в векторное …
Трансформеры для предложений являются расширениями традиционных моделей Трансформер …
Трюк репараметризации — это фундаментальный метод, используемый в вариационных …
Pyannote Audio — это комплексный набор инструментов, предназначенный для упрощения …
Метод «Произведение экспертов» (PoE) используется для построения сложных вероятностных …
Мультимодальное обучение представлений включает обучение моделей обработке и интеграции …
В GAN схлопывание моды возникает, когда генератор учится эксплуатировать слабости …
Эта гипотеза объясняет, почему глубокое обучение эффективно работает, несмотря на …
Магистральные сети (Highway Networks) разработаны для решения проблемы затухания …
Скрытый слой состоит из нейронов, которые получают входные данные от предыдущих слоев, …
Аппаратное обеспечение для ИИ относится к специализированным вычислительным устройствам, …
Эта стратегия оптимизации позволяет обучать модели глубокого обучения с эффективными …
Затворная рекуррентная единица (GRU) — это специализированная ячейка рекуррентной …
Обучение признаков, часто ассоциируемое с глубоким обучением, позволяет моделям изучать …
Энергетические модели (EBM) определяют распределение вероятностей над входными данными с …
Адаптация к домену решает проблему, когда обучающие и тестовые данные имеют разные …
Двойной спуск бросает вызов традиционному компромиссу между смещением и дисперсией, …
DP-SGD — это вариант стохастического градиентного спуска, разработанный для защиты …
BERT (Bidirectional Encoder Representations from Transformers) — это метод машинного …
Этот метод корректирует и масштабирует активации так, чтобы они имели нулевое среднее …
AlphaChip — это специализированная система искусственного интеллекта, предназначенная для …
Состязательные атаки используют уязвимости нейронных сетей, внося тонкий шум во входные …
Компьютерное зрение (CV) — это раздел искусственного интеллекта, который обучает …
Остаточные соединения, также известные как skip-connections (пропускные связи), позволяют …
RNN предназначены для распознавания паттернов в последовательностях данных, таких как …
ReLU широко используется в нейронных сетях глубокого обучения благодаря своей …
Сети LSTM решают проблему затухающего градиента, характерную для стандартных RNN, …
В нейронных сетях метод Dropout предотвращает переобучение путем временного удаления …
Функция активации вносит нелинейность в нейронную сеть, позволяя ей изучать сложные …
Предварительно обученная модель — это фундаментальная ИИ-модель, прошедшая обширное …
Диффузионные модели — это класс генеративного ИИ, который создает новые выборки данных, …
Перенос обучения использует предварительно обученные модели для повышения …
Предобучение — это фундаментальная техника в глубоком обучении, при которой модель …
Нейронная сеть — это серия алгоритмов, которые стремятся распознать скрытые взаимосвязи в …
Многоголовое внимание расширяет стандартный механизм внимания, запуская его несколько раз …
Большие языковые модели (LLM) — это передовые системы искусственного интеллекта, …
Диффузионные модели — это класс генеративного ИИ, который учится обращать стохастический …
Adam (Adaptive Moment Estimation) — популярный алгоритм оптимизации первого порядка на …
Дообучение предполагает взятие модели, уже обученной на большом общем наборе данных, и её …
Сверточные нейронные сети (CNN) предназначены для автоматического и адаптивного изучения …
Механизм внимания позволяет модели динамически оценивать важность различных элементов во …