T2I
Definition
Text-to-Image(T2I)生成では、拡散モデルやGANなどのディープラーニングモデルを使用して、自然言語のプロンプトに基づいて画像を合成します。これらのモデルは、 …
Terms tagged with Computer Vision
Text-to-Image(T2I)生成では、拡散モデルやGANなどのディープラーニングモデルを使用して、自然言語のプロンプトに基づいて画像を合成します。これらのモデルは、 …
類似度学習は、類似したアイテムが近くに、異なるアイテムが遠くなるように、入力をベクトル空間にマッピングするモデルを訓練することに焦点を当てています。サイエズネットワークやトリプレ …
Sam3は、SAM(Segment Anything Model)のような広く認知された標準的な公開AI用語ではありません。これはサードパーティによる反復版、SAM 2の誤記、あ …
Sam3 Videoは、高度なセグメンテーションモデル(MetaのSegment Anything Modelの仮説的または特定バージョンの可能性あり)を動画データに適用すること …
表現崩壊とは、特に自己教師ありのコントラスト学習フレームワークにおいて、ニューラルネットワークがすべての入力データポイントを同じ固定された出力ベクトルにマッピングするように学習し …
光学文字認識(OCR)は、画像処理とパターン認識アルゴリズムを使用して、デジタル画像内のテキストを識別します。印刷物や手書きの文字をマシンエンコード可能な形式に変換し、情報のデジ …
物体検出は、画像分類を超え、画像内にどのような物体が存在するかだけでなく、それらがどこにあるかを特定します。検出された項目の周囲に境界座標(バウンディングボックス)を出力し、対応 …
マスク生成とは、特定の操作中にデータセットのどの要素が見えるか、あるいは活性状態にあるかを決定する空間的または時間的なマスクを生成するプロセスです。コンピュータビジョンでは、物体 …
LocateAnythingは、自然言語プロンプトや一般的な事前知識に基づいて、画像内の物体を検出しセグメンテーションできる汎用的なコンピュータビジョンフレームワークです。事前訓 …
インテリジェント文字認識とは、ニューラルネットワークによって駆動される高度な光学式文字認識(OCR)技術を指します。単純なパターンマッチングを超え、文脈を理解し、ノイズのあるデー …
画像から画像へ(Image To Image、I2I)は、GAN(敵対的生成ネットワーク)や拡散モデルなどの深層学習モデルを使用して、ある画像を別の画像に変換するプロセスです。単 …
画像から画像への変換(I2I)は、GANや拡散モデルなどの深層学習モデルを用いて、ソースドメインの画素をターゲットドメインにマッピングするプロセスです。これにより、スタイル転送や …
方向性変位ヒストグラム(HOD)は、動画解析のための特徴抽出手法であり、静止画のHOG(方向性勾配ヒストグラム)の概念を時間次元に拡張したものです。動画内の光フローベクトルのヒス …
Google Clipsは、Googleによって開発された消費者向け電子デバイスであり、デバイス上の機械学習を利用して、顔やペットなど興味深いシーンや被写体を識別し、自動的に撮影 …
Googleによって開発されたEfficientNetは、ネットワークの深さ、幅、入力画像の解像度をバランスよく調整するための複合スケーリング法を使用します。このアプローチによ …
この用語は、動画生成のために設計されたHugging Face Diffusersライブラリ内の特定の実装を指します。これは、潜在空間での動画拡散(latent video …
Diellaは、解像度を上げたりノイズを除去したりすることで画像品質を向上させるために最適化された特定のニューラルネットワークモデルを指します。これらのアーキテクチャは通常、高度 …
ディープラーニング・アンチエイリアシングとは、ニューラルネットワークを活用して、高周波信号が不十分なレートでサンプリングされた際に発生するエイリアシングアーティファクトを軽減する …
Flickr30Kキャプションは、視覚的内容を記述する5つの異なる英語文で注釈付けされた3万1,783枚の画像からなる、広く使用されているベンチマークデータセットです。これは基盤 …
対照的言語-画像事前学習(CLIP)は、インターネット上の画像とそれに対応するキャプションで訓練されたニューラルネットワークアーキテクチャです。これは、画像とテキストの埋め込み空 …
CAMは、入力画像上にオーバーレイされるヒートマップを生成し、特定のクラスラベルに対するモデルの判断にどのピクセルが最も貢献したかを示します。これは、最終的な畳み込み層に対してグ …
二段階アーキテクチャは、複雑なタスクを2つの分離されたステップに分割します。通常、検出に続き分類や精製が行われます。コンピュータビジョンでは、Faster R-CNNなどのオブジ …
ファイングレインド分析とは、主要なクラスだけでなく、サブクラスレベルでオブジェクトや概念を識別および分類することを含みます。例えば、犬の品種全体を「犬」として分類するのではなく、 …
AIにおける「ビジュアル」という用語は、主にコンピュータビジョンを指します。これは、機械がデジタル画像、動画、その他の視覚入力から意味のある情報を抽出することを目的とした分野で …
AIにおける知覚は、生センサーデータを上位レベルの推論モジュールで処理できる意味のある情報に変換することを含みます。これには、視覚シーンを解釈するためのコンピュータビジョン …
コンピュータビジョンやロボティクスにおいて、モーションは視覚データや物理システム内の動きの検出と分析を指します。オプティカルフローなどのアルゴリズムは、見かけ上の運動のパターンを …
マッチングは、異なるデータエンティティ間の関係を確立するために機械学習で用いられる重要な技術です。コンピュータビジョンでは、特徴量マッチングにより画像間で対応する点を特定し、他の …
検出は、AIモデルが関心対象のエンティティの存在と位置を特定する、コンピュータビジョンおよび信号処理のコアタスクです。単にラベルを割り当てる分類とは異なり、検出は通常、物体の境界 …