
拓海先生、先日部下から「職業を判定するAIに偏りがある」と聞きまして。ただ、どこが問題でどこを直せばいいのか分からず困っています。要するに導入リスクがあるということでしょうか。

素晴らしい着眼点ですね!大丈夫、一緒に考えれば必ずできますよ。今回の論文は、職業を判定するモデルが性別に関してどのように誤った扱いをするかを、大規模な実データで示しています。要点を3つで説明しますね。1) 性別の明示的な表示があると偏りが出やすい、2) それを消しても代替の手がかり(proxy)が残り偏りが残る、3) 繰り返し用いられると不公平が拡大し得る、です。

これって要するに、名前や代名詞がそのままだと、モデルが「男らしい」「女らしい」仕事と結びつけてしまうということでしょうか。では、それを消せば公平になるのではないですか。

素晴らしい着眼点ですね!ただ、必ずしもそうはならないんです。論文では名前や代名詞を削除する「スクラビング」を行っても、モデルが別の手がかり、たとえば特定の職業に多い言い回しや経験の記述を使って性別を推測し、結果として正答率の性差(TPRギャップ)が残ると示しています。身近なたとえで言えば、名札を外しても歩き方や服装で性別を判断されるようなものですよ。

なるほど。では、実務ではどう対処すれば良いのでしょうか。投資対効果の観点から、どこに手を打つのが現実的ですか。

大丈夫、整理しましょう。要点を3つにまとめます。1) データでどの職業にどの性が多いかをまず把握すること、2) 性別の明示表示を消すだけで終わらせず、モデルの出力(正答率の男女差)を職業ごとに監視すること、3) 必要ならばモデル設計側で公平性を考慮した評価指標や再学習(リバランスや代替損失)を導入すること、です。これなら段階的に投資して確かめられますよ。

監視とは具体的にどんな数値を見ればいいのですか。うちの現場でもわかる指標で教えてください。

素晴らしい着眼点ですね!実務向けにはTPR(True Positive Rate、真陽性率)ギャップを見てください。職業ごとに男性と女性で正しく分類される割合の差を計算し、それが大きい職業は問題ありと判断します。加えて全体精度だけで判断せず、職業別の差に注目することが大切です。これならExcelで表にして経営判断できますよ。

それなら現場判断がしやすそうです。最後に、我々のような会社が取り組みを始める際の初手を一言で教えていただけますか。

大丈夫、一緒にやれば必ずできますよ。まずは小さなデータセットで職業別TPRを算出し、名前や代名詞の有無でどれだけ差が出るかを確認してみましょう。その結果をもとに、対策を段階的に導入する。これが現実的で投資効率の良い初手です。

わかりました。では私の言葉で確認します。まず職業ごとの男女別正答率を見て、名前を消したテストも行い、差が残る職業を優先的に対策する。これで投資を段階的に掛けていけば良い、という理解で合っていますか。

素晴らしい着眼点ですね!その通りです。問題の所在を可視化して小さく検証を回す。必要なら我々でモックを作りながら評価指標を整えますよ。大丈夫、一緒にやれば必ずできます。


