双曲正切 (Tanh)
Definition
双曲正切(Tanh)函数是一种非线性激活函数,常用于神经网络。它将输入值压缩到(-1, 1)区间内,提供零中心的输出,这有助于加速收敛。
Summary
Tanh(双曲正切)是一 …
Terms tagged with Deep Learning
双曲正切(Tanh)函数是一种非线性激活函数,常用于神经网络。它将输入值压缩到(-1, 1)区间内,提供零中心的输出,这有助于加速收敛。
Tanh(双曲正切)是一 …
相似度学习专注于训练模型,将输入映射到向量空间,其中相似的项目彼此靠近,不相似的项目相距较远。常用的技术包括孪生网络和三元组损失函数。
一种机器学习方法,通过学习 …
句子变换器是传统变换器模型(如BERT)的扩展,经过微调以产生整个句子的有意义稠密向量表示。与标准的基于标记的模型不同,它们直接输出句子级别的嵌入。
专门设计用于 …
重参数化技巧是变分自编码器及其他概率模型中使用的一种基本方法。它通过将随机变量表示为确定性函数和独立噪声变量的组合,使得梯度能够流经随机节点,从而允许使用反向传播算法进行优化。 …
Pyannote Audio 是一个综合性的工具包,旨在促进说话人日志系统的开发和部署。它提供了一系列预训练的神经网络模型,用于执行各
Pyannote …
专家乘积(PoE)是一种通过组合更简单的分布来构建复杂概率分布的方法。与平均概率的“混合专家”(MoE)不同,PoE通过乘法结合各个专家模型的输出。这意味着如果任何一个专家模型认 …
多模态表示学习涉及训练模型以处理和整合来自不同类型数据源(如文本、图像、音频和视频)的信息,将其映射到共享的潜在空间中。
一种同时从多个数据模态中学习统一特征表示 …
在 GAN 中,当生成器学会利用判别器的弱点,仅产生少量看似合理的样本,而忽略数据分布的其他模式时,就会发生模式崩溃。这种现象会导致生成多样性严重不足。
模式崩溃 …
这一假说解释了尽管存在维度灾难,深度学习为何能高效工作。它表明,尽管图像等数据存在于数百万维的空间中,但它们受到内在结构的约束…
假设高维现实世界数 …
高速公路网络旨在通过引入自适应门控来控制信息流,从而解决深度学习中的梯度消失问题。类似于LSTM单元,这些门允许网络决定保留多少原始输入信息以及多少经过变换的信息。这使得训练非常 …
隐藏层由神经元组成,这些神经元接收来自前一层层的输入,应用权重和偏置,并通过激活函数将转换后的数据传递到下一层。这些层使神经网络能够…
神经网络中输 …
人工智能硬件指的是针对机器学习工作负载所需的巨大并行处理能力进行优化的专用计算设备。这包括用于通用并行计算的图形处理器(GPU),以及专门针对张量运算定制的张量处理单元(TPU) …
这种优化策略允许深度学习模型使用超出 GPU 显存容量的有效批量大小进行训练。通过从多个小批量中累积梯度并执行权重更新,可以实现这一目标。
梯度累积是一种通过在前 …
门控循环单元(GRU)是一种专门的循环神经网络(RNN)单元,旨在捕捉序列数据中的长期依赖关系。它简化了长短期记忆(LSTM)架构。
一种使用门控机制控制信息流动 …
特征学习通常与深度学习相关联,使模型能够直接从原始输入数据中学习分层表示,而不是依赖人工特征工程。通过多层网络结构,模型可以自动提取从低级到高级的抽象特征,从而减少对领域专家手动 …
基于能量的模型(EBM)使用源自能量函数的未归一化密度函数来定义输入数据的概率分布。能量函数将数据点映射到实数,合理的配置具有较低的能量,而不合理的配置具有较高的能量。模型通常通 …
领域自适应解决了训练数据和测试数据来自不同分布的挑战。通过对齐有标签的源领域和无标签或稀疏标签的目标领域之间的特征表示,该方法能够提升模型的泛化能力。
一种通过利 …
双重下降挑战了传统的偏差-方差权衡理论,表明高度过参数化的模型即使插值了训练数据,也能实现较低的测试误差。起初,随着模型复杂度的增加,误差会上升,但在越过插值阈值后,误差会再次下 …
DP-SGD 是随机梯度下降的一种变体,旨在保护训练数据的隐私。它通过裁剪每个样本梯度的贡献来限制敏感度,然后添加高斯噪声来实现隐私保护。
一种优化算法,通过对标 …
BERT(Bidirectional Encoder Representations from Transformers)是由Google开发的一种基于Transformer的机 …
该方法在训练期间调整并缩放激活值,使其在每个小批量中具有零均值和单位方差。它减少了内部协变量偏移,允许使用更高的学习率和更快的收敛速度。
批归一化是一种技术,通过 …
AlphaChip是一个专门的AI系统,旨在自动化并增强微芯片上组件的放置和布线过程。通过采用深度强化学习,它显著缩短了设计周期。
由Google …
对抗攻击通过向图像或文本等输入引入细微噪声,利用神经网络的漏洞,导致模型输出出现显著错误。这些攻击突显了模型在面临恶意输入时的脆弱性。
对抗攻击是一种技术,通过在 …
计算机视觉(CV)是人工智能的一个分支,旨在训练计算机从数字图像、视频和其他视觉输入中提取有意义的信息。它涉及开发算法来模拟人类的视觉能力。
计算机视觉是人工智能 …
残差连接(也称为跳跃连接)通过将输入直接添加到后续层的输出来允许梯度在网络中流动。这种架构解决了深层网络中的梯度消失问题。
一种将输入直接加到层输出上的机制,以促 …
由于其计算效率高且能缓解梯度消失问题,ReLU 被广泛应用于深度学习的神经网络中。其数学定义为 f(x) = max(0, x),它引入了非线性特性(原文截断, …
RNN 旨在识别数据序列中的模式,例如文本、基因组、手写体或语音。与前馈网络不同,它们具有内部记忆,能够捕获关于先前输入的信息(原文截断,意为 captures …
LSTM网络通过使用细胞状态和三个门控机制(输入门、遗忘门和输出门),解决了标准RNN中常见的梯度消失问题。这些门控机制调节信息的流动,使网络能够记住或忘记特定信息。 …
在神经网络中,Dropout 通过在每次训练步骤中临时移除随机子集的神经元来防止过拟合。这迫使网络学习在联合使用时有用的鲁棒特征。
Dropout 是一种正则化技 …
激活函数为神经网络引入非线性,使其能够学习数据中的复杂模式和关系。如果没有这些函数,多层网络的行为将退化为线性变换,无法处理复杂任务。
根据输入信号确定神经网络节 …
预训练模型是一种基础人工智能模型,已在海量且多样化的数据集(如维基百科或ImageNet)上进行了广泛训练。这种初始训练使模型能够学习到广泛通用的特征表示。
预训 …
基于扩散的模型是一类生成式AI,它们通过从随机分布中迭代去除噪声来创建新的数据样本。该过程始于一个前向阶段,即缓慢地向数据中添加高斯噪声,直到数据变为纯噪声;随后通过训练神经网络 …
迁移学习利用预训练模型来提高在新且相关任务上的性能并减少训练时间。开发人员无需从头开始训练,而是对现有权重进行微调,从而利用先前学到的知识。
一种机器学习技术,将 …
预训练是深度学习中的一种基础技术,模型从海量数据中学习广泛的特征和模式,通常无需标签。这一过程使模型能够发展出通用的知识表示,从而在后续针对特定下游任务进行微调时,仅需少量数据即 …
神经网络是一系列算法,通过模拟人类大脑运作的方式,试图识别一组数据中的潜在关系。它由层组成
一种受生物大脑启发的计算系统,由组织成层的互连节点或神经元组成。 …
多头注意力通过并行运行多次标准注意力机制(使用不同的学习到的线性投影)来扩展标准注意力机制。这使得模型能够联合关注来自不同位置的不同表示子空间的信息。
大语言模型(LLM)是基于Transformer架构的高级人工智能系统,在包含大量文本和代码的数据集上进行训练。它们学习语言中的统计模式,
一种在海量文本语料库上 …
扩散模型是一类生成式AI,它们学习逆转向数据添加噪声的随机过程。通过训练神经网络逐步预测并去除噪声,它们能够生成高质量的新数据样本。
一种生成建模技术,通过逆转逐 …
Adam(自适应矩估计)是一种流行的基于一阶梯度的优化算法,用于训练深度神经网络。它结合了两种其他随机梯度下降扩展的优势。
一种为每个参数计算自适应学习率的优化算 …
微调涉及在一个已在大而通用数据集上训练好的模型基础上,继续在专业化数据集上进行训练。这使得模型在保留通用知识的同时,能够习得特定任务的技能。
使用较小的数据集将预 …
卷积神经网络(CNN)旨在从视觉输入中自动且自适应地学习特征的空间层次结构。它们利用卷积层应用滤波器来检测局部模式,并通过池化等操作逐步提取高层语义特征。
一类专 …
注意力机制使模型能够动态地权衡输入序列中不同元素的重要性。与平等对待所有输入数据不同,它会根据上下文分配不同的权重,从而让模型聚焦于最相关的信息部分,显著提升了对长序列数据的处理 …