# topic-cv > CV分野の重要概念・キーワード辞書。メモへのリンクとファクトチェック状態を管理 - Author: tsuji tomonori - Repository: tsuji-tomonori/survey - Version: 20251231231240 - Stars: 0 - Forks: 0 - Last Updated: 2026-02-06 - Source: https://github.com/tsuji-tomonori/survey - Web: https://mule.run/skillshub/@@tsuji-tomonori/survey~topic-cv:20251231231240 --- --- name: topic-cv description: CV分野の重要概念・キーワード辞書。メモへのリンクとファクトチェック状態を管理 --- # CVトピック・キーワード辞書 CV(コンピュータビジョン)分野の重要な概念・キーワードを蓄積します。 ## キーワード辞書 ### アーキテクチャ #### vision-transformer - 定義: Transformerアーキテクチャを画像認識に適用したモデル(ViT) - 関連メモ: [[vision-transformer]] - 初出論文: - - ファクトチェック: 未確認 #### convolutional-neural-network - 定義: 畳み込み層を用いた画像処理向けニューラルネットワーク - 関連メモ: [[cnn]] - 初出論文: - - ファクトチェック: 未確認 #### unet - 定義: エンコーダ・デコーダ構造とスキップ接続を持つセグメンテーション用アーキテクチャ - 関連メモ: [[unet]] - 初出論文: - - ファクトチェック: 未確認 ### 生成モデル #### diffusion-model - 定義: ノイズを段階的に除去して画像を生成するモデル - 関連メモ: [[diffusion-model]] - 初出論文: - - ファクトチェック: 未確認 #### generative-adversarial-network - 定義: 生成器と識別器の敵対的学習による生成モデル - 関連メモ: [[gan]] - 初出論文: - - ファクトチェック: 未確認 ### マルチモーダル #### clip - 定義: 画像とテキストの対照学習による大規模事前学習モデル - 関連メモ: [[clip]] - 初出論文: - - ファクトチェック: 未確認 #### text-to-image - 定義: テキスト記述から画像を生成するタスク - 関連メモ: [[text-to-image]] - 初出論文: - - ファクトチェック: 未確認 ### 評価指標 #### fid - 定義: 生成画像と実画像の特徴量分布の距離を測る指標 - 関連メモ: [[fid]] - 初出論文: - - ファクトチェック: 未確認 #### map - 定義: 物体検出の評価指標、Precision-Recall曲線の下面積 - 関連メモ: [[map]] - 初出論文: - - ファクトチェック: 未確認 ### イベントカメラ・ニューロモルフィック #### event-camera - 定義: 各ピクセルが輝度変化を非同期にイベントとして出力するセンサ。高時間分解能・低消費電力 - 関連メモ: [[event-camera]] - 初出論文: - - ファクトチェック: 未確認 #### event-frame - 定義: 時間窓内のイベントを2D画像に蓄積した表現。極性(Pos/Neg)や発生回数を符号化 - 関連メモ: [[event-frame]] - 初出論文: [[P-2501.00741_v4]](説明として記載) - ファクトチェック: 確認済み(2025-12-26) #### sobel-event-frame - 定義: Event Frameにソーベルフィルタを適用しエッジを強調した表現 - 関連メモ: [[sobel-event-frame]] - 初出論文: [[P-2501.00741_v4]] - ファクトチェック: 確認済み(2025-12-26) ### アテンション機構 #### efficient-channel-attention - 定義: SENetのチャネルアテンションを軽量化。1D畳み込みで実装し、パラメータ削減 - 関連メモ: [[efficient-channel-attention]] - 初出論文: [[ECA-Net-Wang2020]] - ファクトチェック: 確認済み(2025-12-26) ### 3D再構成 #### voxel-reconstruction - 定義: 3D空間をボクセル(3次元格子)で離散化し、占有状態を予測する再構成手法 - 関連メモ: [[voxel-reconstruction]] - 初出論文: - - ファクトチェック: 未確認 ### Attention操作によるスタイル転写 #### self-attention-manipulation - 定義: Diffusionモデル等のSelf-Attention層でQ/K/Vを操作し、画像編集・スタイル転写を実現する手法 - 補足: Q(何に注目するか), K(どこを参照するか), V(何を取得するか)を別画像から混合することでスタイル転写 - 関連メモ: [[self-attention-manipulation]] - 初出論文: [[P-2501.00816_v1]](MixSA) - ファクトチェック: 確認済み(2025-12-27) - 関連手法: Prompt-to-Prompt, ControlNet #### training-free-method - 定義: 追加学習なしで事前学習済みモデルを活用し、新機能を実現するアプローチ - 補足: 推論時のAttention操作、プロンプト工夫等で実現。データ収集・学習コスト不要 - 関連メモ: [[training-free-method]] - 初出論文: [[P-2501.00816_v1]] - ファクトチェック: 確認済み(2025-12-27) ### RGB-D・深度センシング #### surface-normals - 定義: 深度画像から推定した各画素の法線ベクトル。3D形状情報を2D画像として表現 - 補足: Depthより情報量が多く、ジェスチャー認識等で単一モダリティとして最も有効な場合あり - 関連メモ: [[surface-normals]] - 初出論文: -(一般的手法)、[[P-2501.00935_v1]]で有効性を実証 - ファクトチェック: 確認済み(2025-12-27) ### マルチモダリティ融合 #### late-fusion - 定義: 各モダリティで独立に推論後、出力(スコア/確率)レベルで統合する融合戦略 - 補足: スコア加算のargmax、投票、重み付き平均等の方法あり。Early/Middle Fusionより実装が簡単 - 関連メモ: [[late-fusion]] - 初出論文: -(一般的手法) - ファクトチェック: 確認済み(2025-12-27) ### トポロジー保存・連結性維持 #### simple-voxel - 定義: 除去しても周囲のオブジェクトの連結性を変えないボクセル(デジタルトポロジーの概念) - 補足: non-simple voxelは除去するとトポロジーが壊れる=セグメンテーションエラーの原因 - 関連メモ: [[simple-voxel]] - 初出論文: -(デジタルトポロジーの古典的概念) - ファクトチェック: 確認済み(2025-12-27) #### supervoxel - 定義: 連結したボクセルの集合。simple voxelの概念をボクセル集合単位に拡張 - 補足: 1ボクセルずつの判定より効率的にトポロジーエラーを検出可能 - 関連メモ: [[supervoxel]] - 初出論文: [[P-2501.01022_v3]](supervoxel-loss) - ファクトチェック: 確認済み(2025-12-27) #### critical-component - 定義: 除去すると連結成分数が変わる(トポロジーが壊れる)ボクセル集合 - 補足: negatively critical = 偽陰性成分で、splitエラーの原因。positively critical = 偽陽性成分で、mergeエラーの原因 - 関連メモ: [[critical-component]] - 初出論文: [[P-2501.01022_v3]] - ファクトチェック: 確認済み(2025-12-27) #### topology-aware-loss - 定義: セグメンテーションのトポロジー(連結性、Betti数等)を保存するよう設計された損失関数 - 補足: persistent homology系(TopoLoss, DMT)、skeleton系(clDice)、voxel系(Gornet, supervoxel-loss)等の分類あり - 関連メモ: [[topology-aware-loss]] - 初出論文: -(複数手法の総称) - ファクトチェック: 確認済み(2025-12-27) - 代表手法: TopoLoss, DMT, clDice, Gornet, supervoxel-loss ### Video Transformer #### video-transformer - 定義: 動画認識向けTransformerアーキテクチャ。フレーム特徴をCNN等で抽出後、時間方向のAttentionを適用 - 関連メモ: [[video-transformer]] - 初出論文: - - ファクトチェック: 未確認 #### multiscale-multi-head-attention - 定義: Transformerの各Attentionヘッドで異なる次元(ピラミッド構造)を使用し、マルチスケール特徴を抽出する手法 - 補足: MViTがPoolingでマルチスケール化するのに対し、Attention次元でマルチスケール化 - 関連メモ: [[multiscale-multi-head-attention]] - 初出論文: [[P-2501.00935_v1]](MsMHA-VTN) - ファクトチェック: 確認済み(2025-12-27) --- ## 関連fix Skill - [[fix-cv/SKILL.md]]