文生图 (T2I)
Definition
文生图(T2I)生成涉及使用深度学习模型(如扩散模型或GANs),根据自然语言提示合成图像。这些模型学习文本与图像之间的相关性。
Summary
T2I …
Terms tagged with Computer Vision
文生图(T2I)生成涉及使用深度学习模型(如扩散模型或GANs),根据自然语言提示合成图像。这些模型学习文本与图像之间的相关性。
T2I …
相似度学习专注于训练模型,将输入映射到向量空间,其中相似的项目彼此靠近,不相似的项目相距较远。常用的技术包括孪生网络和三元组损失函数。
一种机器学习方法,通过学习 …
Sam3 不像 SAM(Segment Anything Model)那样是一个广泛认可的标准公共 AI 术语。它可能指第三方的迭代版本、SAM 2 的拼写错误, …
Sam3 Video 指的是将高级分割模型(可能是 Meta 的 Segment Anything Model 的假设性或特定版本)应用于视频数据。它涉及跨帧跟踪对 …
当神经网络(特别是在自监督对比学习框架中)将所有输入数据点映射到同一个固定的输出向量时,就会发生表征坍塌。这种平凡解虽然最小化了损失函数,但未能学习到有用的特征表示。 …
光学字符识别(OCR)利用图像处理与模式识别算法来识别数字图像中的文本。它将打印或手写的字符转换为机器编码的数据,从而实现信息的数字化提取。
OCR 是一项将扫描 …
目标检测扩展了图像分类的功能,不仅确定存在哪些对象,还确定它们的位置。它输出检测到的项目周围的边界坐标及其类别标签。
一种计算机视觉技术,使用边界框在图像或视频流 …
掩码生成涉及产生空间或时间掩码,以确定在特定操作期间数据集的哪些元素是可见或激活的。在计算机视觉中,它用于对象分割、图像修复等任务;在自然语言处理中,则用于控制注意力机制。 …
LocateAnything 是一个多功能计算机视觉框架,能够基于自然语言提示或通用先验知识,检测并分割图像中的物体。它利用预训练的基础模型泛化能力,实现零样本环境下的精准定位与 …
智能文字识别是指由神经网络驱动的高级光学字符识别(OCR)技术。它超越了简单的模式匹配,通过理解上下文并处理n
利用人工智能算法(特别是深度学习)准确识别和解读来 …
图像到图像(Image To Image, I2I)涉及使用深度学习模型(如生成对抗网络GANs或扩散模型)将一张图像转换为另一张图像。与简单的滤镜不同,I2I可以极大地改变外 …
图像到图像(I2I)翻译涉及使用深度学习方法(如生成对抗网络 GAN 或扩散模型),将源域中的像素映射到目标域。它允许进行风格迁移、语义分割等操作,实现不同图像域之间的转换。 …
方向位移直方图(HOD)是一种用于视频分析的特征提取方法,它将HOG(方向梯度直方图)的概念扩展到时间维度。它在光流向量中计算位移的方向和幅度分布,从而能够有效地描述视频片段中的 …
Google Clips 是谷歌开发的一款消费电子产品,它利用设备端的机器学习来识别有趣的场景和主体(如人脸或宠物),并自动拍摄照片或视频。该产品旨在简化摄影过程,让用户专注于体 …
由Google开发,EfficientNet使用复合缩放方法来平衡网络深度、宽度和输入图像分辨率。这种方法使模型能够在保持参数效率的同时达到最先进的准确率水平。
该术语指 Hugging Face Diffusers 库中专为视频生成设计的特定实现。它集成了 Stable Video Diffusion (SVD) 模型,这是一种潜在视频 …
Diella 指的是针对提高图像质量(通过增加分辨率或去除噪声)而优化的特定神经网络模型。这些架构通常采用先进的注意力机制或残差连接来提高重建图像的感知质量。
一 …
深度学习抗锯齿是指利用神经网络减轻混叠伪影的方法,混叠伪影发生在高频信号以不足的速率采样时。在计算机图形学…
使用神经网络减少渲染图像或下采样特征中 …
Flickr30K Captions 是一个广泛使用的基准数据集,包含 31,783 张图像,每张图像都标注了五个不同的英文句子来描述视觉内容。它作为构建跨模态理解模型的基础资 …
对比式语言-图像预训练(CLIP)是一种在图像及其对应的互联网标题上训练的神经网络架构。它使用对比目标来最大化共现(图像-文本对的相似度)。
一种多模态预训练方 …
CAM 在输入图像上叠加热力图,以显示哪些像素对模型针对特定类别标签的决策贡献最大。它通过对最终卷积层应用全局平均池化来工作,从而定位关键特征区域。
类激活映 …
两阶段架构将复杂任务划分为两个独立的步骤,通常涉及检测后跟分类或细化。在计算机视觉中,典型的例子包括像 Faster R-CNN 这样的对象检测器,先生成区域建议,再进行分类。 …
细粒度分析涉及在子类别层面而非仅仅在主类别层面识别和分类对象或概念。例如,区分狗的具体品种或不同品牌的智能手机,而不是仅仅将其归类为“动物”或“电子产品”。这要求模型捕捉更细微的 …
AI 中的“视觉”一词主要涉及计算机视觉领域,该领域致力于使机器能够从数字图像、视频和其他视觉输入中提取有意义的信息。它涉及图像处理、对象检测等技术。
与视力或图 …
AI 感知涉及将原始传感器数据转换为可由更高层推理模块处理的意义信息。这包括用于解释视觉场景的计算机视觉、用于处理声音的语音识别以及用于理解文本的自然语言处理。
…
在计算机视觉和机器人领域,运动指的是对视觉数据或物理系统中移动的检测与分析。光流等算法用于估计视在运动的模式。
物体相对于时间和参考系的位置随时间的连续变化。 …
匹配是机器学习中用于建立不同数据实体之间关系的关键技术。在计算机视觉中,特征匹配用于识别图像间的对应点;在推荐系统中,则用于匹配用户偏好与物品特征。
匹配涉及将两 …
检测是计算机视觉和信号处理的核心任务,AI模型在此过程中识别感兴趣实体的存在及其位置。与仅分配标签的分类不同,检测通常还包含定位信息(如边界框)。
在数据集或环境 …