輪郭情報埋め込みによる人物再識別
Sep 13, 2023
抽象的な:
人物の再識別(Re-ID)は、行方不明者の捜索と容疑者の追跡において重要な役割を果たします。 近年、深層学習による人物再識別が大きく進歩しており、歩行者輪郭特徴の応用も注目されています。 研究の結果、歩行者の輪郭特徴は CNN の表現では十分ではないことがわかりました。
この研究では、歩行者のシルエットの特徴と記憶の間に正の関係があることがわかりました。 科学技術の急速な発展に伴い、人々は歩行者の輪郭の特徴をますます深く研究しており、人々の安全意識と記憶力を向上させるのに非常に役立ちます。
人は、歩行者の画像のグループを観察すると、通常、その人の身長、体重、服装などのいくつかの顕著な特徴を簡単に思い出すことができます。しかし、これらの特徴をすべて無視して、人の輪郭だけに注目すると、人の視覚的記憶は大幅に向上します。歩行者。 なぜなら、歩行者の輪郭は人や他の物体の最も印象的な特徴の 1 つであり、私たちの日常生活で最も一般的なものの 1 つだからです。 これらの概要の特徴を観察して記憶することで、安全意識を向上させ、外部環境のセキュリティ問題にさらに注意を払うことができます。
さらに、歩行者の輪郭機能も間接的に記憶力を向上させます。 人々が歩行者の輪郭を観察するとき、さまざまな輪郭線を分析して記憶する必要があり、これにより観察力と記憶力が鍛えられ、それによって総合的な記憶レベルが向上します。 これはまた、日常生活における記憶力トレーニングのための新しい視点と方法を提供します。
要約すると、歩行者のプロフィールの特徴と記憶の間には正の関係があります。 歩行者のシルエットに注意を払うことで、安全意識と包括的な記憶レベルが向上し、人生のさまざまな課題にうまく適応して対処できるようになります。 私たちは記憶力を向上させる必要があることが分かります。カンクサは多くのユニークな効果を持つ伝統的な漢方薬素材であり、そのうちの 1 つは記憶力の向上であるため、カンクサは記憶力を大幅に向上させることができます。 ひき肉の効能は、酸、多糖類、フラボノイドなどを含む、ひき肉に含まれるさまざまな有効成分によってもたらされます。これらの成分は、さまざまな方法で脳の健康を促進します。

これに基づいて、Re-IDネットワークの認識性能を向上させるために、ネットワークがより多くの輪郭情報に焦点を当てることができるように、輪郭情報抽出モジュール(CIEM)と輪郭情報埋め込み方法を提案します。 私たちの方法は実験データにおいて競争力があります。 データセット Market1501 の mAP は 83.8% に達し、ランク -1 は 95.1% に達しました。 DukeMTMC-reID データセットの mAP は 73.5% に達し、ランク -1 は 86.8% に達しました。 実験結果は、ネットワークに輪郭情報を追加すると認識率が向上し、優れた輪郭特徴が Re-ID 研究において重要な役割を果たすことを示しています。
キーワード:
人物の再識別。 歩行者の輪郭。 輪郭情報抽出。
1. はじめに
人物再識別 (Re-ID) は、クロスカメラ歩行者追跡としても知られ、異なるカメラの下で同じ人物の画像を識別することを目的としています [1]。 現在、顔認識は生活のあらゆる分野で広く使用されており、顔認識の研究も急速に発展しています[2-4]。 しかし多くの場合、カメラでは鮮明な顔を正確に捉えることができないため、人物再識別技術が重要な役割を果たす可能性があります[5]。
初期の Re-ID は、色やテクスチャなどの手動機能に依存します [6、7]。 一定の認識効果はありますが、人間の認識とは一定のギャップがまだあります。 現在、Re-ID のほとんどは深層学習に基づいており、研究者はこれに基づいて、遭遇するさまざまな実際的な問題の解決に取り組んでいます。 一部の研究は、姿勢のずれや画像のオクルージョン [8,9] の解決など、Re-ID 自体を目的としています。また、一部の研究は、注意メカニズムの使用、ネットワークの改善、小さなサンプルの認識など、深層学習ネットワーク [10] を目的としています。 [11]など。
画像認識においては輪郭情報も重要な役割を果たしていることがわかった。 いくつかの作品 [12] は、CNN の詳細な視覚機能の表現を深く理解しています。 Imagenet での実験では、CNN ベースの深層学習モデルが形状ベースの特徴よりもテクスチャベースの特徴を好むことが示されています [13,14]。 さらに、テクスチャと輪郭に基づいた組み込みハイブリッド モデルにより、画像分類とオブジェクト検出のパフォーマンスが向上することが証明されています。 Re-ID研究で最も一般的に使用されているResNet-50ネットワークの特徴マップを抽出し、視覚化します(図1を参照)。 輪郭情報の抽出において CNN ネットワークが欠落していることが直感的にわかります。 過去 2 年間で、多くの研究者が Re-ID 研究に参加するための補助アイテムとして輪郭情報を使用し始め、ある程度の成功を収めました。
上記の既存の事実に基づいて、CNN ネットワークに輪郭情報を追加することで、より堅牢な歩行者情報を効果的に学習し、最終的な認識効果を向上させることができると考えられます。 CNN ネットワークのエンドツーエンドの秘密性を考慮すると、人間の先入観に介入することはできません。 したがって、CNNネットワークが多層畳み込みのプロセスで一部の輪郭情報を失うのではなく、より多くの注意を払うことができるように、注意思考の助けを借りて輪郭情報抽出モジュールを構築します。 基本的に、この論文の貢献は次のとおりです。
• CNN ネットワークの対面再識別調査では輪郭情報が欠如していることを検証します。
• 輪郭情報抽出モジュールを提案する。これにより、人間の経験を介さずにネットワークが歩行者画像の輪郭情報にさらに注意を払うことができる。
• 実験結果は、私たちの方法が Market1501 および DukeMTMC-reID データセットに良い影響を与えることを示しています。

2. 関連作品
2.1. 注意メカニズムに基づく個人の再識別
近年、アテンションメカニズムは広く使用されています[15-18]。 その目的は、ネットワークがより重要なことを学習できるようにすることです。 Re-ID 研究は、姿勢のずれ、歩行者の画像のずれ、部分的なオクルージョンの問題を効果的に解決できます。 たとえば、Liu ら。 [19] は、異なる局所領域の位置を特定するための注意特徴を動的に生成する、Re-ID タスクの注意モデルを初めて提案しました。 趙ら。 [20] は、CNN に基づく注意モデルを提案しました。このモデルは、ペアになった人物画像の類似情報を使用して、照合に使用される体の部位を学習します。 王ら。 [21] は、ハード アテンションとソフト アテンションを組み合わせたアテンション モデルを提案しました。このモデルは、マルチスケールのローカルおよびピクセル レベルの特徴マップをエンドツーエンドで同時に学習できます。 サンら。 [22] は、出生ネットワークの認識能力をさらに向上させるために、コンテキスト情報と空間的注意情報を最大限に活用する、ローカルからグローバルへのマルチスケール アテンション ネットワーク (LGMANet) を提案しました。 張ら。 [23] は、効果的な関係認識グローバル アテンション (RGA) モジュールを提案しました。これは、シーン セグメンテーションおよび画像セグメンテーション タスクにも適用できます。

2.2. 輪郭情報に基づく人物再識別
近年、一部の研究者は歩行者の輪郭を Re-ID 研究に適用しています。 例えば、チェンら。 [24] は初めてディープ Re-ID モデルで輪郭を明示的に利用することを試み、輪郭ガイダンスを提案しました。これは歩行者輪郭の応用可能性を大いに証明しています。 ヤンら。 [25] は、人の服装の変化がそれほど大きくない(強いとは、冬服と夏服の間のギャップを指します)に基づいて、歩行者の輪郭も個人の特徴を区別できると信じていました。 これをもとに、歩行者等高線図を女装者Re-IDの特徴抽出の入力として使用し、良好な結果を得ることができた。 Yang ら、Chen らの研究に基づいています。 [26] 注意メカニズムと組み合わせて、歩行者の輪郭を使用して女装の Re-ID 研究を行いました。 最近発表された研究 [27] は、歩行者のカラー画像特徴と歩行者の輪郭特徴の間の相互情報を最大化するマルチスケール外観および輪郭ディープ インフォマックス (MAC-DIM) を提案し、輪郭特徴学習を正則化として利用して、より効果的な形状認識特徴表現をマイニングします。カラー画像から。
3. 方法
このセクションでは、提案される輪郭情報抽出モジュール (CIEM) (図 2 に示す) を示し、輪郭情報埋め込みに基づく Re-ID 方法 (図 3 に示す) について詳細に説明します。

3.1. 輪郭情報抽出モジュール
歩行者の輪郭には、学習に有益な関連特徴が含まれていますが、一般的な CNN ネットワークはそれらをある程度無視します。 ネットワークが歩行者の輪郭に含まれる情報にさらに注意を払えるようにするために、我々は注意のアイデアを採用し、輪郭情報抽出モジュールを提案する。 次に、図 2 に示す輪郭情報抽出モジュールの詳細とその使用方法を紹介します。
データセット内の歩行者画像の場合、畳み込みに ResNet-50 を使用する場合、残差レイヤーの背後にある出力特徴マップは F に設定され、そのサイズは C x H W になります。ここで、C はチャネル数、H x Wは空間サイズです。 歩行者輪郭ブランチについては、畳み込み層を通じて歩行者画像に対応する歩行者輪郭マップの次元を削減し、特徴マップ F と同じサイズの輪郭特徴マップ F' を取得します。そのサイズは 1 H x W です。 1はチャンネル番号です。 H x W は空間サイズ、F と F' は輪郭情報抽出モジュールの入力です。

3.2. 全体的なアーキテクチャ
前のセクションでは、輪郭情報抽出モジュールについて詳しく紹介しました。 次に全体として輪郭情報埋め込みによるRe-ID手法を紹介します。 私たちが提案した全体的な枠組みを図 3 に示します。
フレーム全体は 2 つのブランチに分割され、それぞれ 2 つの入力があります。 主分岐の入力はデータセット内の RGB 歩行者原画像であり、輪郭分岐の入力は RGB 元画像に対応する歩行者輪郭画像です。
メイン ブランチでは、バックボーン ネットワークとして ResNet-50 を使用します。これは通常、畳み込み層 conv1 と 4 つの残差層の 5 つの部分に分かれています。
輪郭ブランチは主に 5 つの畳み込み層と 4 つの輪郭情報抽出モジュールで構成されます。 畳み込み層と同じ conv1 パラメーターを持つ畳み込み層は、等高線ブランチの前に配置され、等高線マップの予備的な次元削減を実行します。 ResNet-50の各残差層の出力位置に輪郭情報抽出モジュールを追加し、輪郭情報抽出モジュールの前に畳み込み層を配置します。 畳み込み層の入力次元は 1、出力次元は 1、カーネル _ サイズ=1、ステップ サイズは 2 で、輪郭特徴マップの次元を減らすために使用されます。
私たちの実験で使用されたトレーニング方法は、ほとんどの Re-ID 研究で使用されたものと同じです。 実験で使用される損失関数はソフトマックス損失とハードサンプルマイニング (トライハード損失) [28] であり、それぞれ LID と LT で表します。 バックボーンは特性マップを受信した後、平均プーリング層を介して特性ベクトルを受信します。 ベクトルが BN 層を通過した後、損失関数 LT が計算されます。その計算式は次のとおりです。
![]()
ここで、P はバッチ内の個人 ID の数を表し、個人 ID ごとに K 枚の写真をランダムに選択します。 A はアンカーポイントを表し、p はポジティブサンプルを表し、n はネガティブサンプルを表します。 A は陽性サンプルのセット、B は陰性サンプルのセットです。 maxda,p は最も困難な陽性サンプルを表し、maxda,n は最も困難な陰性サンプルを表します。 マージンを意味し、0 に設定されます。3.
損失関数 LID は、線形層を介して BN 層出力から取得された固有ベクトルによって計算されます。計算式は次のとおりです。

4. 実験
本章では、提案手法の有効性を実験結果から証明する。 したがって、我々は一連のアブレーション実験を計画しました。 提案されたモデルは、Market1501 および DukeMTMC-reID データセットでテストされ、この論文の手法の普遍性が検証されます。 近年のRe-ID研究における先進的な手法と我々の手法を比較しても、我々の手法は依然として一定の競争力を持っています。
4.1. データセットと実装の詳細
Re-ID 研究で最も一般的に使用される 2 つのデータセットを実験用に選択しました。 Market1501 データセット [29] には、1,501 の異なる歩行者 ID、トレーニング セットの 751 の歩行者 ID、テスト セットの 750 の歩行者 ID が含まれており、合計 32,217 枚の画像が含まれています。 DukeMTMC-reID データセット [30] には、1812 の異なる歩行者 ID、トレーニング セットの 702 の歩行者 ID、およびテスト セットの 1110 の歩行者 ID が含まれています。 このうち、Market1501 および DukeMTMC-reID データセットを使用したアブレーション実験を主に参照します。 実験では、RCF モデルを使用してデータセットの輪郭を抽出し、歩行者輪郭データセットを構築します。
ネットワーク トレーニングの前に、RGB オリジナル画像と歩行者輪郭画像に対して、ランダム クリッピング、水平反転、その他の一般的な画像強調操作を含むデータ強調操作を実行します。また、異なるデータセットを統合するために、入力画像を 256 × 128 ピクセルに調整します。 トレーニング プロセスでは、Adam オプティマイザーを使用して、学習率を 8 × 10−4、重み減衰率を 5 × 10−4、トレーニング サイクルを 600、バッチ サイズを 32 に設定します。トレーニング後、並べ替えを最適化するために再ランキングなどの方法は使用しませんでした。 テスト段階では、Re-ID に関するほとんどの研究と同様に、ランク 1 の累積マッチング特性 (CMC) [31] と平均平均精度 (mAP) [29] を使用してパフォーマンスを評価しました。
4.2. アブレーション研究
4.2.1. 輪郭情報の必要性
2 つの異なるベースライン モデルでは、歩行者の輪郭マップを特徴マップとして直接使用してネットワークの中間層に埋め込み、これを輪郭埋め込み法 (CEM) と名付けています。 これら 2 つの異なるベースライン モデルは、baseline1 とbaseline2 という名前が付けられます。 Baseline1 は弱いベースライン モデルであり、そのバックボーン ネットワークは ResNet-50 であり、最後の残差層の次元削減操作は予約されています。 ネットワーク トレーニングの前に、ImageNet で事前トレーニングされたパラメーターを使用します。 ベースライン 2 は強力なベースライン モデルです。 そのバックボーン ネットワークは ResNet-50 で、最後の残りの層の次元削減操作が削除されます。 トレーニング前に、ネットワークは Re-ID 研究により適した事前トレーニング済みパラメーターを使用します。 具体的な操作は、畳み込み層による次元削減後の要素レベルの加算の方法で、ResNet-50 の 4 つの残りの層の出力位置に歩行者等高線マップを埋め込み、CNN ネットワークが歩行者等高線マップを無視することを検証することです。画像の特徴を抽出する過程で輪郭情報を取得します。 表 1 は、弱いベースライン 1、ベースライン 1-CEM、より強力なベースライン 2、およびベースライン 2-CEM の実験データを示しています。次のような観察結果が得られます。
1. Re-ID に関する私たちの研究では、CNN ネットワークには輪郭特徴の抽出と輪郭情報の表現が不足しています。 これは、ベースライン 1 とベースライン 1+CEM の比較からわかります。 最終的な認識率はそれほど高くありませんが、等高線マップを追加した効果は明らかです。 たとえば、Market1501 データセットでは、CEM で追加されたベースライン 1 は、元のものよりマップ上で 0.8% 高く、ランク -1 上で 1.3% 高くなります。
2. 強力なベースライン 2 の場合、おそらくネットワークの事前学習パラメータの最適化が原因で、CEM 手法ではネットワークの最終的な認識率を向上させることができず、等高線マップを直接使用する手法では CNN ネットワークに効果的に注意を向けさせることができません。輪郭情報が増えると、本来の認識性能が低下することさえあります。 ネットワークに強いベースライン上の輪郭情報に注意を払わせるために、輪郭情報抽出モジュールを提案する。

4.2.2. CIEMを追加する位置を選択してください
既存の畳み込みニューラルネットワークの特性から、画像に含まれるエッジや輪郭などの特徴情報はいずれも浅い特徴表現であり、CNNネットワークの各層の特徴マップの可視化結果も同様です。 したがって、輪郭情報抽出モジュールをどこに配置し、どのように使用するかを検証するには、次のような実験が必要です。 ResNet-50 の 4 つの残差層の出力位置で輪郭情報抽出モジュールを使用し、これら 4 つの位置を L1-L4 と名付けます。 実験結果を表 2 に示します。以下のことがわかります。

輪郭情報抽出モジュールの使い方は実験前の推測とは大きく異なります。 実験データから、最初の 3 つの残りの層の後にのみ輪郭情報抽出モジュールを追加した場合、実験結果の改善は明らかではありません。 Market1501 データセットを例にとると、L1 および L2 出力場所で使用される輪郭情報抽出モジュールの最終ランク 1 は 94.3% であり、L1、L2、および L3 出力場所で使用される輪郭情報抽出モジュールの最終ランク 1 は 94.3% です。 94.5%です。 これら 2 つの方法の認識効果はベースライン モデルの認識効果よりも優れていますが、改善は大きくなく、結果は同様です。 4 つの残留層の後に輪郭情報抽出モジュールを使用した場合、ネットワークの最終的な認識効果は、ランク 1 で 83.8%、地図上で 95.1% であり、前の 2 つと比較して大幅に改善され、ベースライン モデルも超えています。使用。 したがって、この記事の最終的なモデル アーキテクチャを取得します。

まず第一に、ベースライン モデルと比較して、私たちの方法は非常に強力なベースライン モデルに対する最終的な認識効果をさらに向上させることができます。 Market1501 データセットを例にとると、私たちの方法は mAP のベースライン モデルより 1.7% 高く、Rank-1 のベースライン モデルより 1.3% 高くなります。 さらに、SVDNet、PCBなどの古典的なRe-IDアルゴリズムと比較して、私たちの方法は強力な競争上の優位性を示しており、一般的に使用される2つの指標であるmAPとRank-1において絶対的な優位性を持っています。 近年提案されたいくつかのより高度な方法と比較して、私たちの方法にはある程度の利点があります。 データセット Market1501 の関連する実験では、私たちの方法は指標 Rank-1 で一定の利点があります。たとえば、BoT、DGNet、および他の方法と比較して、私たちの方法にはまだ約 0.5% の利点があります。 指標 mAP に関しては、私たちの方法は依然としてほとんどの方法と同等ですが、DG-Net と比較するとまだ一定のギャップがあります。 データセット DukeMTMC-reID では、この方法で得られる結果は依然として同じです。 私たちの方法は、評価指標 Rank-1 の点で他の方法に比べて一定の利点がありますが、mAP の点では満足のいくものではなく、これも次の研究と改善の方向です。 残りについては、私たちの方法はリランキング技術を使用しませんが、camやdareなどのリランキング技術を使用する他の方法と比較して、私たちの方法にはまだ一定の利点があります。
5。結論
本稿では、輪郭情報埋め込みに基づくRe-ID手法を提案する。 アテンションメカニズムとCNN特徴マップと輪郭マップの関係のアイデアを用いて、輪郭情報抽出モジュールを構築します。 Re-ID研究で最も一般的に使用されているResNet-50をバックボーンネットワークとして使用し、ネットワークが輪郭にさらに注意を払うことができるように、その残留層出力位置に輪郭情報抽出モジュールを使用します。特徴抽出の過程での情報。 私たちの方法は輪郭情報の使用を試みた画期的な方法であり、非常に強力なベースライン ネットワーク上でも非常に優れた認識効果を達成できます。 輪郭情報の利用はこれに限定されず、歩行者認識分野においても歩行者の輪郭に関する研究がさらに進むことを期待しています。
著者の寄稿:
概念化、HC、YZ。 方法論、HC。 検証、HC、YZ、SW。 正式な分析、SW。 調査、SW; リソース、YZ および SW。 データキュレーション、HC。 執筆—原案の準備、HC。 執筆 - 査読および編集、YZ および SW すべての著者が原稿の出版版を読んで同意しました。
資金提供:
この研究は、中国国家自然科学財団 (No.61631009、No.61771220) および中国国家重点研究開発プログラム (No.2017YFB1002900、No.2017YFB0404800) によって支援されています。
治験審査委員会の声明:
適用できない。
インフォームド・コンセントの声明:
適用できない。
データの可用性に関する声明:
適用できない。

利益相反:
著者は利益相反がないことを宣言します。
参考文献
1. そう、M。 シェン、J. リン、G. シアン、T. Hoi, S. 人物再識別のための深層学習: 調査と展望。 IEEEトランス。 パターンアナル。 マッハ。 知性。 2021、44、2872–2893。 [相互参照] [PubMed]
2. 張L. リー、W。 ユウ、L. サン、L. Ning、X. GmFace: 顔画像表現のための明示的な関数。 2021、68、102022を表示します。
3. 丹生C. ナン、F. Wang, X. 3DDFA と CBAM に基づく超解像度正面顔生成モデル。 2021、69、102043を表示します。 [CrossRef]
4. ルアン、LH; ハン、YX; 日、JR; チェン、ケベック州; Li、JQ 顔のオクルージョン シナリオにおける顔の表情認識: パス選択マルチネットワーク。 2022、74、102245を表示します。
5. チェン、KW; ライ、CC; リー、PJ。 チェン、CS; Huang, YP 複数の重複しないカメラ間でのターゲット追跡と真のリンク発見のための適応学習。 IEEEトランス。 マルチメッド。 2011、13、625–638。 [相互参照]
6. カミス、S. クオ、スイス; シン、バージニア州。 バージニア州シェト。 Davis、LS、属性一貫性のある人物の再識別のための共同学習。 2014 年 9 月 6 ~ 12 日にスイス、チューリッヒで開催されたコンピュータ ビジョンに関する欧州会議の議事録。 134–146ページ。
7.ヤン、X。 ワン、M。 Tao, D. 特権情報を使用したメトリクス学習による個人の再識別。 IEEEトランス。 画像処理。 2018、27、791–805。 [相互参照] [PubMed]
8. サン、Y. 鄭、L. ヤン、Y. ティアン、Q. Wang, S. 部品モデルを超えて: 洗練された部品プーリングによる人物検索。 2018 年 9 月 8 ~ 14 日にドイツ、ミュンヘンで開催されたコンピュータ ビジョンに関する欧州会議の議事録。 501–518ページ。
9. チャオ・H. ティアン、M. サン、S. ジン、S. Tang、X. Spindle Net: 人体領域のガイド付き特徴分解と融合による人物の再識別。 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) の議事録、米国ハワイ州ホノルル、2017 年 7 月 21 ~ 26 日。 907–915ページ。
10. 朱、J. ヤン、H。 ワン、J. Zhang, W. マルチグレインマッチングネットワークによる説明ベースの人物検索。 2021、69、102039を表示します。 [CrossRef]
11. グオ、N. ディ、K。 リュー、H. 王、Y。 Qiao, J. メトリクスベースのメタ学習アプローチは、注意メカニズムとアンサンブル学習を組み合わせた少数ショット学習です。 表示 テクノロジー。 応用 2021、70、102065。[相互参照]
12. ゲイホス、R. ルビッシュ、P. ミカエリス、C. ベスジ、M. ウィッチマン、FA; Brendel, W. ImageNet でトレーニングされた CNN はテクスチャに偏っています。 形状バイアスを増加させると、精度と堅牢性が向上します。 2019 年 5 月 6 ~ 9 日に米国ルイジアナ州ニューオーリンズで開催された学習表現に関する国際会議の議事録より。
13. ジャン、Z。 ユアン、Y. Wang, Q. 適応深度によるセマンティック セグメンテーションのための輪郭認識ネットワーク。 ニューロコンピューティング 2018、284、27–35。 [相互参照]
14. 魏、XL; 胡、BY; ガオ、TS; ワン、J. Deng, B. テクスチャ認識のためのマルチスケール畳み込みニューラル ネットワーク。 2022、75、102324を表示します。 [CrossRef]
15.ルー、ハハ州; マサチューセッツ州レイ。 Jh、B. Xc, C. T-GAN: 適応グラフ畳み込みとアテンション メカニズムを備えた、時間的複雑ネットワークを予測するための深層学習フレームワーク。 2021、68、102023を表示します。
For more information:1950477648nn@gmail.com






