機械学習アルゴリズムを使用した音声信号からの特徴パラメータ抽出の改善(2)

May 30, 2023

3.7. データセット データセットの収集および生成プロセスは次のように実行されました。 この研究では、120 時間の音声を含むデータセットがモデルのトレーニングに使用されました。 データセットには、最大 15 単語、合計長約 120 時間の文で構成される音声録音が含​​まれています。

Desert living cistanche

砂漠高麗人参

さらに、データセットには、言語モデルの開発に使用される大量のさまざまなテキストが含まれています。 テキスト コーパスに含まれる 90,650 を超える発話、415,780 の単語、および 65,810 の固有の単語が収集され、約 120 時間の文字起こしされた音声データが得られました。 データセットをトレーニング、検証、テスト セットに分割しました。 データセットの統計

表 3 に報告されています。

表 3. データセットの仕様。

Table 3. The dataset specifications.

データセットを、トレーニング セット、検証セット、テスト セットに対応する 3 つのフォルダーに分割しました。 各フォルダーには音声録音とトランスクリプトが含まれています。 音声と対応する文字起こしファイル名は同じですが、音声録音が WAV ファイルとして保存されるのに対し、文字起こしは UTF-8 エンコードを使用した TXT ファイルとして保存される点が異なります。 すべての転写は、29 文字からなるラテン文字とアポストロフィ記号を使用して表されます。 過学習を防ぐために、速度摂動とスペクトル強調に基づいたデータ拡張技術を適用しました。

Cistanche deserticola slice (11)

カンクイ

4. 提案手法

音声認識システムを開発する際のプログラマーにとっての重要なタスクは、音声信号のパラメトリック表現に最適な方法を作成することです [45]。 この方法により、話者が発音パターンや音響環境の変化に敏感にならないようにしながら、音と話し言葉をうまく分離することができます。 単語認識におけるほとんどのエラーは、マイクのシフトや発音のピッチの違いによる信号のピッチの変化によって引き起こされます [46]。 エラーのもう 1 つの一般的な原因は、スペクトル形状のランダムな非線形変形です。これは話者の音声信号に常に存在します [47、48]。 したがって、効果的な音声認識システムを作成する際の最も重要なタスクの 1 つは、分析された信号の内容に十分であり、話者の声やさまざまな音響環境の影響を受けない表現を選択することです。

Cistanche supplement near me—Improve memory2

近くのカンクサプリメント - 記憶力の向上

特徴パラメータを抽出するために使用されるシステムには、通常、次の要件があります。 情報コンテンツ、つまり特徴パラメータのセットは、認識可能な音声要素の信頼できる識別を保証する必要があります。 さらに、ラウドネス、つまりオーディオ信号の最大圧縮とパラメータの非統計的相関を最小限に抑える必要があります。 話者からの独立性も達成する必要があります。つまり、話者の特性に関する情報を文字ベクトルから最大限に除去する必要があります。 最後に、均一性(パラメータが同じ平均分散を持ち、単純なメトリクスを使用して文字セット間の類似性を決定する機能を指す)を提供する必要があります [49]。 しかし、これらの要件は相反するものであるため、すべての要件を同時に満たすことが常に可能であるとは限りません。 音声要素のパラメトリック記述は、それらを確実に区別できるように十分に詳細である必要があり、できるだけ簡潔である必要があります。

Desert living cistanche

スーパーマンハーブのシスタンシュ

実際には、マイクから受信した音声信号は 8 ~ 22 kHz のサンプリング レートでデジタル化されます。 連続した数値は 10 ~ 30 ms の音声断片(フレーム)に分割され、準定常的な音声部分に相当します。 特徴のベクトルが各フレームから計算され、その後、音声認識の音響レベルで使用されます。 現在、自己相関分析、ハードウェア線形フィルタリング、スペクトル分析、LPC に基づく信号のパラメトリック表現には、幅広い方法が利用可能です。 音声パラメータ化の最も一般的なアプローチは、信号フラグメントのスペクトル分析とそのケプストラム係数の計算です。

MFCC は音声信号の情報特徴として使用されています [41]。 これらの特性は音声認識で広く使用されており、ケプストラル スケールとメル スケールという 2 つの主要な概念に基づいています。 このアルゴリズムの主な利点は、親しみやすさと話しやすさの高さです。 MFCC 特徴は、録音された音声信号から分離されます。 MFCC アルゴリズムは、レコードおよびスペクトル切り替えアルゴリズムの結果を使用します。 MFCC の計算に使用される古典的なアルゴリズムを図 5 に示します。

Figure 5. Classical scheme for calculating MFCCs.

図 5. MFCC を計算するための古典的なスキーム。

この研究は、音声信号から関数パラメータを抽出する迅速な方法を提示します。 MFCC を高速に計算するために提案されたアルゴリズムを図 6 に示します。

Figure 6. Proposed framework for calculating MFCCs.

図 6. MFCC を計算するための提案されたフレームワーク。

音声信号から関数パラメータを迅速に抽出するための提案アルゴリズムの実行シーケンスを検討する

4.1. フレームへの分割

予備フィルタリングの後、音声信号は 16 ミリ秒のフレームに分割されます。 すべてのフレーム (最初のフレームを除く) には、前のフレームの最後の 10 ミリ秒が含まれます。 このプロセスは信号が終了するまで続きます。 この研究では、音声信号のサンプリングレートが 16 kHz であるため、フレーム長は N=256、オフセット長は M=160 です。 オーバーラップはフレーム長の 62.5% です。 一般に、フレーム長の 50% ~ 75% をカバーすることが推奨されます。

4.2. ハニング ウィンドウと減少する値

1D のハニング ウィンドウ サイズが使用されました。 ハニング ウィンドウはレイズド コサイン ウィンドウとも呼ばれます。 ハニング ウィンドウは、3 つの長方形の時間ウィンドウの周波数スペクトルの合計と考えることができます。 サイドローブを使用して互いに打ち消し合い、高周波干渉とエネルギー漏洩を排除できます。 ハニング ウィンドウは非常に便利なウィンドウ関数です。

cistanche—Improve memory4

近くのカンクサプリメント - 記憶力の向上

ここをクリックして、記憶力を改善し、アルツハイマー病を予防するCistanche製品をご覧ください。

【さらに質問する】 メール:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

歪みを軽減し、個々のフレームを滑らかにするためにウェイト ボックスが使用されます。 この研究で調査した浮動信号は、密なトーンで構成されています。 フラット トーンの大きさは、ハニング ウィンドウでフィルタリングされた周波数 f の純音の大きさによって決まります。

このウィンドウの重要な点は、フレームの境界線をゼロに設定することです。 この場合、短いエネルギーはウィンドウを通過しながら計算でき、最小振幅エネルギーの計算に使用されるシーケンスから転送できます。 目的は、このウィンドウから信号を平滑化しながら信号エネルギーを計算することで、信号から低エネルギー信号を除去することです。 このプロセスには、次の信号エネルギー方程式が必要です。


image

ここで、En は入力信号フラグメントのエネルギー、xi は信号値です。

(11) を使用したウィンドウ プロセスに加えて、信号は次のステップで処理され、プロセッサに入力される値の数が大幅に減少します。 図 7 は、並列処理アルゴリズムを示しています。

ウィンドウ サイズはサンプル数と継続時間を表します。 これは分析の主要なパラメータです。 ウィンドウのサイズは、基本周波数、強度、信号の変化によって異なります。

image

図 7. 無音部分を除去するためのハニング ウィンドウ アルゴリズム。 4.3. 短時間フーリエ変換 (STFT) スイッチ 高さの高さまたは低さの意味は直感的に理解できます。 STFT は、時間の経過とともに変化する信号のローカル セクションの正弦波周波数と位相内容を決定するために使用されるフーリエ関連変換です。 実際には、STFT の計算では、長い時間信号を同じ長さの短いセグメントに分割し、その後、それぞれの短いセグメントでフーリエ変換を個別に計算します。これにより、各短いセグメントのフーリエ スペクトルが明らかになります。離散時間信号は次のとおりです。実際に使用されます。 対応する時間周波数変換は離散フーリエ変換であり、信号 Xn の長さを N 個の係数の複素数値周波数領域を表すものとして記述します。 STFT は時間の経過に伴う周波数成分の変化を記述し、音声分析と処理に最も広く使用されているツールの 1 つです [50]。 スペクトル自体と同様に、STFT の利点の 1 つは、そのパラメーターが物理的かつ直感的に解釈できることです。 STFT は通常、対数スペクトル 20log10 (X(h, k)) を使用して視覚化されます。 このような 2D 対数スペクトルは、スペクトログラムとして知られる熱マップを使用して表示できます。 アルゴリズムの第 3 段階では、STFT スペクトル切り替え手順が重みウィンドウを通過するフレームに適用されます。 信号の STFT は、ウィンドウを開いて各ウィンドウの DFT を決定することによって取得されます。 特に、入力信号の Xn ウィンドウと Wn ウィンドウの変換は次のように決定されます。

image

ここで、k-index は周波数値に対応し、wn は窓関数で、通常はゼロを中心とするハニング ウィンドウまたはガウス ウィンドウです。

4.4. メル変身

第 4 段階では、周波数帯域に転送された信号が、三角フィルターを使用して範囲に分割されます。 フィルターの境界は、チョーク周波数を使用して計算されます。 チョーク周波数 fi フィールドへの移行は、次の方程式に基づいています。

image

ここで、f は周波数範囲です。

リバーススイッチは次のように決定されます。

image

NN を fifilter (通常は 26 の fifilter が使用されます) および flflow の数 (研究対象の周波数範囲と同じくらい高い) と考えてください。 この範囲はメル スケールに変換され、均等に分散された NN の交差範囲に分割されます。 周波数に適した線形境界は fi フィールド内で決定されますが、フィルタリングに基づいて取得される重み付け係数は H で示されます。その後、フーリエ変換から取得された係数の二乗係数にフィルタが適用されます。 取得される値は、次の式により対数になります。

image

特異値分解アルゴリズムは、MFCC を計算する最後の段階で実装されます。

5. 実験結果

表 4 に示すように、4.90 GHz CPU、32 GB の RAM、および 2 つの Nvidia GeForce 2080Ti GPU を搭載した PC 上の Visual Studio 2019 C plus plus で、提案された方法を実装してテストしました。システムは、さまざまなデバイス環境でテストされました。信号特徴抽出法のパフォーマンスを評価します。 実験では、アルゴリズムの動作中 (図 8)、信号の表面のシーケンスが n=15 の場合、値の数は 40 ~ 50 パーセント減少し、処理時間は 1 増加しました。 2-折ります。 その結果、このアルゴリズムは大幅に高い効率を示しました。 さらに、このアルゴリズムにより、ハニング ウィンドウを通過する際の無音領域の分離と削除が可能になりました。

メモリ帯域幅の無駄を避けるために、いくつかの可能な手段が利用可能です。 信号フレームのサイズをキャッシュ メモリのブロック サイズに一致させることで、コンピューティング パフォーマンスを向上させる新しいソリューションを提案します。 このタイプの最適化は、全体的な並列処理のパフォーマンスに大きな影響を与える可能性があります。 ただし、マルチコア プロセッサでの実装を通じて信号をフレームに分割することにより、デジタル信号処理で使用することができます。 ただし、実際には、キャッシュ メモリとメイン メモリを接続するデータ バスの幅とそのブロックのサイズに応じて、選択は小規模に実行されるのが通常です。 私たちの方法は、並列コンピューティングでこれらのメモリを最適に使用することを実装します。 キャッシュ メモリの構成は、データをストリームに分割する際の並列処理アルゴリズムにおいて重要な役割を果たします。 特に、デジタル信号処理におけるベクトル行列効果の存在とそのストリームのサイズは、キャッシュ ブロックのサイズに応じて調整する必要があります。 これは、図 9 に示すように、提案された方法を使用して実現できます。

表 4. 実験セットアップの詳細な仕様。

image

image

図 8. (a) 最初の受信信号と (b) 提案されたアルゴリズムを適用した後の信号の出現。

image

図 9. RK3288 プロセッサを使用した並列コンピューティング構造。

このセクションでは、さまざまなシステムのパフォーマンスを比較するための定量分析について説明します。 私たちの方法を、深層学習アプローチに基づいたよく知られている音声認識アルゴリズムと比較しました。 評価メトリクスは、音声認識のためのさまざまな戦略を計算し、さまざまなアプローチのパフォーマンスを評価するために不可欠です。 比較のために他の研究の結果を使用しましたが、これらの手法のソース コードとデータセットは実際のパフォーマンスを検証するために公開されていないため、それらが真実であるかどうかはわかりません。 図 10 は、提案された高速アルゴリズムに基づいてハニング ウィンドウを通過する音声信号フラグメントの通過中に無音部分を再移動した結果を示しています。 分析から得られた速度の結果を表 5 に示します。

image

図 10. KNN アルゴリズムの k 値 (特徴選択あり)。

表 5. 提案手法の実験結果

image

KNN アルゴリズムで最高の精度値を与える近傍の次数を見つけるために、範囲が決定されています。 指定範囲は 1 ~ 25 です。 図 10 では、特徴選択を伴う KNN アルゴリズムのグラフが適用されています。 グラフを調べたところ、最初に近傍値が 1 だったとき、トレーニング精度はテスト精度よりもはるかに高かった。 相関によって選択された特徴を使用して作成された KNN アルゴリズムでは、モデルの精度はトレーニング データセットで 99.15 パーセント、テスト データセットで 97.35 パーセントであることが判明しました。

通常、単語誤り率 (WER) または文字誤り率は、音声信号からの特徴抽出の精度を評価するために使用されます。 これらは、認識技術を公平に比較​​するのに役立つ客観的なマトリックスです。 私たちの以前の研究 [51-56] では、F 値 (FM)、精度、再現率などの指標を計算しました。 FM は、適合率と再現率の間で測定値のバランスを取る加重平均です。 精度は、予測された陽性の観測値の総数に対する、正しく予測された陽性の観測値の数の比率です。 (9) に示すように、再現率は、実際のクラスの観測値の総数に対する、正しく予測された肯定的な観測値の数の比率です。 次の方程式を使用して、特徴抽出方法の平均精度と再現率を計算できます。

image

ここで、TP は真陽性の数を示し、FP は偽陽性の数を示し、FN は偽陰性の数を示します。

FM は、精度と再現率の両方を考慮して、(10) を使用して計算されます。

image

提案された方法の平均 FM、再現率、精度は 98.4% でした。 マイクでの信号の不要なノイズにより、ケースの 1.6% で誤検出が発生しました。 モデルの精度の範囲は 0 ~ 1 であり、指標推定スコアは 1 で最高値に達しました。私たちの方法と最近公開された他の音声特徴抽出方法の評価を表 6 に示します。同じ数値公平な比較のために機能の数が使用されました。 各グループの合計 325 の音声サンプルが、同様の特徴背景を持つ被験者から分析されました。 MFCCのフィルタバンクの数に応じた異なるフレーム長とLPCの次数の異なるフレーム長の影響も精度向上のために調べられました。

表 6. 音声特徴抽出の定量的精度の結果。

image

前述したように、WER は音声認識パフォーマンスの最も一般的な尺度です。 これは、参照転写と音声認識装置の出力を比較することによって計算されます。 この比較に基づいて、エラーの数を計算することができます。これらは通常、次の 3 つのカテゴリに分類されます: (1) 自動音声認識 (ASR) の出力の参照に単語が存在しない場合の挿入、(2) ASR 出力で単語が欠落している場合の削除、および (3) 単語が別の単語と混同されている場合の置換。 WER は次のように計算できます。

image

ここで、S は誤って認識された単語の置換数、D は削除の数、I は挿入の数、N は参照転写内の単語の数です。 このスコアを計算する際の主な問題は、2 つの単語シーケンス間の位置合わせです。 これは、レーベンシュタイン距離を使用した動的計画法によって決定できます [67]。

表 6 に基づいて、図 11 に示すように、WER 評価指標を使用して比較手法の平均精度を示す統計分析を実行しました。改良された特徴抽出機能では約 98.4 パーセントの精度が得られましたが、他のアプローチでは 98.4 パーセントの精度が得られました。 78パーセントと96パーセント。 関連する論文で提供されている結果を比較のために使用しました。 ただし、これらのメソッドの実際のパフォーマンスを確認するためにこれらのメソッドのソース コードとデータセットが公開されていないため、これらの値の精度を簡単に検証することはできません。 それにもかかわらず、標準的なシーンの場合、提案手法は、音声データにノイズが多かったり、品質が低い場合でも、計算時間を短縮し、優れた音声特徴抽出精度を提供することが実験的に実証されました。

Figure 11. Quantitative results of speech signal feature extraction approaches using vertical graphs.

図 11. 垂直グラフを使用した音声信号特徴抽出アプローチの定量的結果。

さらに、選択した方法の偽陽性結果を評価しました。 図 12 からわかるように、提案されたアプローチのエラーは最も少なくなりました。 さらに、高効率な並列計算手法により、音声信号の特徴選択および抽出エラーが大幅に減少しました。 過剰適合はトレーニング中の主な問題の 1 つであり、ほぼすべての機械学習モデルがこの問題に悩まされています。 私たちは、データセット内の既存の特徴の重要性をランク付けし、重要性の低い特徴を破棄することを目的とした特徴選択手法を使用して、過剰適合のリスクを軽減しようとしました (新しい特徴は作成されません)。

image

図 12. 偽陽性音声信号特徴抽出実験の目に見える結果。

表 7 は、さまざまなプロパティに基づいて音声認識環境で使用されたメソッドのパフォーマンス結果を示しています。 私たちが提案するアプローチは、不要な背景ノイズの影響を受けず、しわがれた声、喉の痛みで発せられる声、さらには完全に声を失った人間からの音など、低品質の人間の声の影響を受けません。 私たちの方法は、不十分な録音機器、背景雑音、難しいアクセントや方言、音声のさまざまなピッチの問題を克服することを目的としています。 通常の環境では、提案された方法を使用すると、処理時間が短縮され、音声特徴の課題を正確に検出および抽出するための最良の結果が得られました。

表 7. さまざまな機能を使用した音声特徴の検出と抽出のパフォーマンスのレビュー。

image

音声認識手法の結果は、7 つのカテゴリーについて、強力、通常、または弱に分類されました。 この強力な基準は、アルゴリズムがあらゆる種類の課題を克服できることを示しています。 対照的に、通常の基準は、単語の境界が事前に定義されていないため、特定の場合にアルゴリズムが失敗する可能性があることを示します。 最後に、弱い基準は、アルゴリズムが背景の騒音や振動の下では信頼できないことを示唆しています。

6. 制限事項

これまでに提案された方法に欠点がないと結論付けるのは困難です。 私たちが提案した方法は、さまざまなノイズ環境によっても誤差が生じる可能性があります。 この問題を克服するために、既存の特徴から新しい特徴を作​​成することで、データセット内の特徴の数を減らすことを目指しました [69]。 過学習は競技中にさまざまなモデルをトレーニングする際の主な問題の 1 つであったため、さまざまなリソースからのデータ サンプルを追加してトレーニング データを強化することが、結果を改善するための可能な解決策となる可能性があります。 前述の問題とは関係なく、実験の結果、私たちの方法は音声特徴抽出タスクに対して非常に堅牢で効果的であり、平均精度が 98.4 パーセント、FM が 99.5 パーセントであることが明らかになりました。

7. 結論

機械学習手法を使用した新しい高性能並列コンピューティング手法が、音声認識システム向けに提案されています。 コンピューティング リソースが限られているマシンの高速化の問題は、分散システムを使用して解決できます。 効率的かつ迅速なアルゴリズムを作成して使用することで、信号認識システムの計算速度を向上させ、マルチコア プラットフォームのパフォーマンスを向上させることができます。 結果は、提案されたモデルが MFCC を効果的に使用することで処理時間を短縮し、特徴抽出精度を 98.4 パーセント向上させることを示しています。 特徴選択によって抽出された相関値の低い特徴もモデルの成功に効果的であることが観察されています。 前処理されたデータに対して統計分析が実行され、K 最近傍 (KNN) 機械学習アルゴリズムを使用してデータから有意義な情報が生成されました。

今後の研究は、深層学習アプローチを使用し、マルチコアプロセッサのキャッシュメモリを最適化し、品質を大幅に損なうことなく音声信号を検出および抽出することにより、私たちの方法の精度を向上させることに焦点を当てます。 さらに、3D CNN および 3D U-Net 環境 [71-] において、Taris 音声データセット [70] を使用して、少ない計算リソースで組み込みデバイスの構築を可能にする、堅牢な解析性能を備えた並列処理に基づくスペクトル解析モデルを構築する予定です。 75]

参考文献

1. 孟、YJ; リュー、WJ。 張、RZ; Du、HS 補間に基づく音声特徴パラメータの抽出と認識。 応用 メカ。 メーター。 2014、602–605、2118–2123。 [相互参照] 2. ムサエフ、M.。 Rakhimov, M. 畳み込みニューラル ネットワークの加速トレーニング。 2020 年情報科学および通信技術に関する国際会議 (ICISCT) の議事録、ウズベキスタン、タシケント、2020 年 11 月 4 ~ 6 日。 1 ~ 5 ページ。 [相互参照] 3. そう、F。 Yang, J. 話者識別のためのディープ ニューラル ネットワーク モデル。 応用 科学。 2021、11、3603。[CrossRef] 4. Musaev、M.。 Rakhimov, M. 音声信号の並列処理でメイン メモリのブロックをキャッシュにマッピングする方法。 2019 年情報科学通信技術国際会議 (ICISCT) の議事録、パキスタン、カラチ、2019 年 3 月 9 ~ 10 日。 1 ~ 4 ページ。 [相互参照] 5. Jiang, N.; Liu, T. SOM と K-means に基づいた改良された音声セグメンテーションおよびクラスタリング アルゴリズム。 数学。 問題。 工学 2020、2020、3608286。[相互参照] 6. Hu、W.。 ヤン、Z。 チェン、C. サン、B. Xie、Q. 数値制御タレットのマルチアクション システムの振動セグメンテーション アプローチ。 信号画像ビデオ処理。 2021、16、489–496。 [相互参照]

7. テネシー州ポペスク; Aiordachioaie、D. 振動信号の最適なセグメント化を使用した転がり要素ベアリングの故障検出。 メカ。 システム。 信号プロセス。 2019、116、370–391。 [相互参照] 8. シハブ、MSH。 アディティヤ、S. セツ、JH; イムティアズ・ウッ・ディン、ケンタッキー州; Efat、MIA 話者識別のためのハイブリッド GRU-CNN 特徴抽出技術。 2020 年 12 月 19 ~ 21 日、バングラデシュのダッカで開催された第 2020 23 回コンピュータおよび情報技術国際会議 (ICCIT) の議事録。 1 ~ 6 ページ。 [相互参照] 9. コルクマズ、O. Atasoy, A. メル周波数ケプストラム係数を使用した音声信号からの感情認識。 第 9 回電気電子工学国際会議 (ELECO) の議事録、トルコ、ブルサ、2015 年 11 月 26 ~ 28 日。 1254–1257ページ。 10. アイヴァズ、アメリカ; ギュリューラー、H. カーン、F. アーメド、N. ワンボ、T. Abdusalomov, A. 機械学習によるメル周波数ケプストラム係数を使用した自動話者認識。 CMC-コンピューティング。 メーター。 コンティン。 2022、71、5511–5521。 11. アル・カデリ、M. ラハマー、E. Rad, A. 異種分類器と相補的特徴連携の融合による 2 レベル話者識別システム。 センサー 2021、21、5097。[CrossRef] 12. バトゥール ディンラー、Ö。 Aydin, N. 音声セグメント検出のためのゲート反復ユニット反復ニューラル ネットワークに基づく最適な特徴パラメーター セット。 応用 科学。 2020、10、1273。[相互参照] 13. キム、H.。 Shin、JW 漏洩抑制と信号回復を備えた TF-GSC ベースのデュアル マイク音声強化。 応用 科学。 2021、11、2816。[相互参照] 14. Lee、S.-J.。 クォン・H.Y. 音声セグメント検出に基づく音声データのノイズ除去のための前処理戦略。 応用 科学。 2020、10、7385。[CrossRef] 15. Rusnac、A.-L.。 Grigore, O. EEG 想像音声認識のための CNN アーキテクチャと特徴抽出方法。 Sensors 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; カーン、MQ; マリク、F. アブドゥサロモフ、AB; チョー・イー; Odarchenko, R. パキスタンの IT 業界における個人の仕事の適性の適度な役割を伴う、プロジェクトの成功に対するアジャイル手法の影響。 応用 科学。 2022、12、10698。[相互参照] 17. Aggarwal、A.。 スリバスタヴァ、A. アガルワル、A. チャハル、N. シン、D. アルヌアイム、AA; アルハドラク、A. リー、H.-N. 深層学習を使用した音声感情認識のための双方向特徴抽出。 Sensors 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; ヴァネロ、N. Fanucci, L. 話者依存の特徴抽出パラメータを最適化して、構音障害のある人の自動音声認識パフォーマンスを向上させます。 Sensors 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; ジェイン、A. アラスカ州シャルマ。 アルムスタファ、KM 心音図信号ベースの多クラス心臓診断意思決定支援システム。 IEEE Access 2021、9、110710–110722。 [相互参照] 20. Mohtaj、S.; シュミット、V. Möller, S. ヘイトスピーチ識別のための特徴抽出ベースのモデル。 arXiv 2022、arXiv: 2201.04227。 21. クルドシュベイ、A. アブドゥサロモフ、A. ムキディノフ、M. バラトフ、N. マフムドフ、F. Cho、YI CNN で使用される超音波画像の自動分類方法の改良。 内部。 J. ウェーブレット多重解像度 Inf. プロセス。 2022、20、2150054。22. パスリチャ、V。 Aggarwal、RK 自動音声認識のためのディープ CNN と双方向 LSTM のハイブリッド。 J.インテル. システム。 2020、29、1261–1274。 [相互参照] 23. ムハマディエフ、A.。 ホジャヤロフ、I。 ジュラエフ、O。 Cho, J. ウズベク語の深層学習アプローチに基づく自動音声認識方法。 Sensors 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; リュー、M. 趙、Y. コング、L. ドン、L. リュー、X。 Hui, M. 1D 畳み込みニューラル ネットワークを使用した心音の特徴抽出と分類。 EURASIP J.Adv. 信号プロセス。 2019, 2019, 59. [CrossRef] 25. Chang, L.-C.; ハン、J.-W. 深音響モデルにおける状態の確率の最大化に基づくロバストな音声特徴抽出の予備研究。 応用 システム。 イノヴ。 2022、5、71。[CrossRef] 26. Ramírez、J.。 ゴリス、JM。 Segura、JC 音声アクティビティ検出。 基礎と音声認識システムの堅牢性。 堅牢な音声認識と理解。 Grimm, M.、Kroschel, 編; I-TECH 教育と出版: 英国ロンドン、2007 年。 1 ~ 22 ページ。 27. Oh, S. 音声認識用に改良された平均予測 LMS フィルターを使用した、DNN ベースの堅牢な音声特徴抽出および信号ノイズ除去方法。 J.コンバーグ. 情報 テクノロジー。 2021年11月1日~6日。 [相互参照] 28. アッバスシアン、BJ。 シエラソーサ、D. Elmaghraby, A. データベースからモデルまでの音声感情認識のための深層学習技術。 Sensors 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; ママジャノフ、D. Mukhiddinov、A. 分散コンピューティングにおける画像処理への高性能並列アプローチ。 2020 IEEE 14th International Conference on Application of Information and Communication Technologies (AICT) の議事録、ウズベキスタン、タシケント、2020 年 10 月 7 ~ 9 日。 1 ~ 5 ページ。 [相互参照] 30. アブドゥサロモフ、A.。 ムキディノフ、M. ジュラエフ、O。 カムダモフ、米国; Whangbo, TK 触覚グラフィックスを生成するための局所適応しきい値に基づく自動顕著オブジェクト抽出。 応用 科学。 2020、10、3350。[CrossRef] 31. アブドゥサロモフ、A.。 Whangbo、TK 屋内環境向けの影除去技術を使用した前景認識方法の改良。 内部。 J. ウェーブレット多重解像度 Inf. プロセス。 2017、15、1750039。[CrossRef] 32. アブドゥサロモフ、A.。 Whangbo、TK 屋内ビデオ ストリームのジオメトリと色情報を使用した移動物体の影の検出と除去。 応用 科学。 2019、9、5165。 [CrossRef] 33. Mery, D. X 線検査のためのコンピューター ビジョン。 Springer International Publishing: スイス、シャム、2015 年。 p. 271、ISBN 978-3319207469。 34. Mark, S. 音声イメージは音声認識の境界を再調整します。 10時。 知覚する。 精神物理学。 2016、78、1496–1511。 [相互参照] 35. ムドガル、E. ムクンタラージ、S. モダック、MU; Rao, YS DSP-TMS320F28335 のデジタル フィルターを使用したテンプレート ベースのリアルタイム音声認識。 2018 年第 4 回コンピューティング通信制御と自動化に関する国際会議 (ICCUBEA) の議事録、インド、プネー、2018 年 8 月 16 ~ 18 日。 1 ~ 6 ページ。 [相互参照]

あなたはおそらくそれも好きでしょう