モデルインバージョン攻撃について紹介
情報社会において、AIを使用したツールを利用する機会が増えました。
AIツールはとても便利ですが、攻撃者も悪用して情報を盗み出そうとします。
今回紹介するのは、AI(機械学習モデル)の出力結果を分析して、その特徴を分析し復元しようとするモデルインバージョン攻撃について紹介します。
モデルインバージョン攻撃とは
モデルインバージョン攻撃(Model Inversion Attack)とは、機械学習モデルの出力結果を分析して学習に使われたデータやその特徴を推測・復元しようとするプライバシー攻撃です。
攻撃者は学習データ自体にアクセスせず、出力結果(モデルの応答)を利用して情報を引き出そうとします。
例えば、顔認証システムは登録された個人の顔情報がAIモデルによって内部パラメータに保存されます。
この内部パラメータを引き出すために、ランダムなデータを入力して出力結果から予測を立てて、修正を繰り返すことで個人情報の特徴を盗み取ります。

対策
対策として、アクセス制御の強化が必要になります。
以下が例になります。
・特定のIPアドレスのみ入力を許可するよう制限する
・アクセス回数を制限する
・不審なクエリパターンの監視をする
・同一ユーザから大量の問い合わせが入っていないか監視する
またAIツールは学習することで利用者にとって便利になるツールではありますが、攻撃者にとっても情報を盗み出す素材となります。
不必要な情報まで学習させることの無いよう、学習の制限も必要になります。(過学習対策)








