顔認識のためのカメラ設置
カメラの設置位置は、アルゴリズムの選定よりも多くの結果を左右します。要点は3つ、顔にかかる解像度、レンズと被写体との角度、そして被写体の背後の照明です。これらを誤れば、どのアルゴリズムでも取り返せません。正しく設計すれば、多くのアルゴリズムは実用的に機能します。
顔には何画素必要か。
重要なのはカメラの画素数ではなく、撮影地点で顔にかかる画素数です。慣例として両目の中心間の画素数で測ります。長い廊下の先を狙った4Kカメラは、出入口を狙った1080pカメラよりも顔に使える画素が少なくなることがあります。解像度が顔以外のすべてに費やされるためです。
- 両目間がおよそ40画素を下回ると、検出はできても、アルゴリズムを問わず認識は不安定になります。
- 扉やゲートでの協力的な撮影であれば、両目間60〜80画素程度が実用的な範囲です。
- およそ120画素を超えると効果は頭打ちになり、照合精度は向上しないまま帯域と保存容量だけが増えます。
- 圧縮は解像度と同じくらい重要です。強いH.264やH.265圧縮は照合が依存する微細なテクスチャを失わせ、高圧縮の4K映像は低圧縮の1080p映像より劣ることがあります。
実務上の結論は、画角こそ争点だということです。幅4メートルの通路を写すカメラはセンサーを4メートル分に配分します。同じカメラで幅1メートルの出入口を写せば、そのすべてが通行者に費やされます。画角を絞るほうが、高解像度カメラを買うより安上がりで効果的なのが通例です。
設置高さと角度はどうすべきか。
顔認識は主に正面および正面に近い画像で学習されているため、正面から外れるほど精度を失います。実際の設置で最も多い誤りは、カメラを高く取り付けて頭頂部を見下ろしている状態です。
- レンズは対象となる人々の目の高さ付近に置きます。立位の成人であればおおむね1.5〜1.8メートルです。
- 俯角は15度以内に抑えます。これを超えると顔が短縮され、眉の下で目が影に入り、照合が依存する幾何形状が歪みます。
- 水平方向のずれも15度以内に。出入口の脇に寄せたカメラは、まっすぐ通る人の横顔を見ることになります。
- いたずら防止のため高所設置が避けられない場合は、俯角を深くするのではなく、カメラを後方に下げて望遠側のレンズを使います。距離は角度を浅くしますが、傾ければ逆です。
- 着座の方や車椅子を利用する方が対象に含まれる場合、目の高さの前提が変わり、1台の高さでは両方に対応できません。どちらにも中途半端な高さではなく、高さの異なる2台が正直な答えです。
照明が最も多くの導入を壊すのはなぜか。
カメラは場面全体に合わせて露出します。被写体の背後に窓やガラス扉があると、カメラは明るい背景に露出を合わせ、顔は情報の取り出せないシルエットになります。デモでは動いたのにロビーでは動かない、という事象の最も一般的な原因がこれです。デモは通常、窓を背にして行われないからです。
- 顔認識カメラを窓、ガラスの出入口、明るい屋外に向けないでください。配置が許す限り、建物の内側に向けます。
- 逆光が避けられない場合は、カメラのワイドダイナミックレンジに頼らず前方から補助光を当てます。WDRは助けにはなりますが、解決にはなりません。
- 撮影地点の真上からの強い照明は避けます。眼窩が影に入り、そこには最も多くの照合情報があります。
- 時間帯による変動に注意してください。西向きの出入口は午前中ずっと問題なく、夏の午後だけ毎日失敗することがあります。午前10時に一度だけ実施した現地調査では見つかりません。
- 赤外照明は暗所での安定した撮影を可能にしますが、赤外画像と可視光での登録画像はうまく照合できないことがあります。赤外で撮影するなら、登録も赤外で行ってください。
被写体の動きは要件をどう変えるか。
ここまでは、対象がほぼ静止しているか、ゆっくり歩いていることを前提としています。動きは2つの問題を加えます。ブレと、正面が見える時間が短くなることです。
- シャッター速度は顔を止められる速さが必要です。低照度ではノイズとの取引になり、その取引は通常、シャッターを遅くするのではなく光を足すことで解決します。
- 1秒未満で通過してしまう撮影範囲では、使えるフレームがほとんど得られません。範囲を広げるか、扉、ゲート、誘導柵などで流れを緩めることがフレームを稼ぎます。
- 通路は開けたコンコースより有利です。経路と、人が向く方向の両方を制約するためです。
- ゲートの幾何条件は見た目より容易です。人は立ち止まり、画面を正面から見て、距離も既知です。ゲートでの精度と通路での精度が比較できない数値である理由がこれです。
現地調査では何を記録すべきか。
設置位置しか記録しない調査では性能を予測できません。以下は、設計の根拠として使える調査に必要な項目です。あえて短くしています。誰も完了しない調査票は、全員が記入する簡潔なものより価値がありません。
- 撮影地点ごとに、設置高さ、俯角、歩行線からの水平方向のずれ、撮影範囲までの距離。
- 撮影範囲の手前端と奥端における両目間の実測画素数。仕様書の値ではなく、実機での測定値。
- 1日のうち最も条件の悪い3つの時間帯における撮影地点の照度、および画角内のすべての窓、ガラス扉、照明器具の記録。
- 想定される進行方向と、立ち止まるかどうか。
- 対象となる人々の構成。子ども、車椅子利用者、宗教上の頭部の覆いを着用する方が含まれるか。登録画像が既にあるか、現地で取得するか。
- 認識が失敗したときにどうするか、すなわち有人での代替手順。これに答えがないなら、設計は完了していません。
最後の2項目は、最も省かれやすく、最も結果を左右します。対象の95パーセントを認識できるシステムにも、残り5パーセントへの対応が必要です。その対応が要員数を決め、要員数が事業性を決めます。
適切な設置でも解決しないことは何か。
設置設計はアルゴリズムが到達できる上限を引き上げます。しかし、登録画像の品質、しきい値の方針、照合結果を受けた運用者の行動には関与しません。カメラが完璧でも、これらのいずれかで導入は失敗しえます。
- 登録画像の品質が低いと、性能は恒久的に頭打ちになります。低品質なスキャンで構築した登録データは、撮影側が何をしても性能を出せません。
- しきい値の選定は技術ではなく方針の判断です。未検出と誤警報の取引であり、適切な設定はその現場でどちらの損失が大きいかによります。
- 時間的な圧力の下での運用者の対応には、自動化バイアスが現れます。後ろに列がある状況で高いスコアを示されることは、機械に異を唱えよという要求であり、人はガバナンス文書が想定するほど頻繁にはそれをしません。
よくある質問
- 顔認識には両目間で何画素必要ですか。
- 両目の中心間がおよそ40画素を下回ると、アルゴリズムを問わず認識は不安定になります。扉やゲートでの協力的な撮影であれば60〜80画素程度が実用範囲で、120画素を超えると効果は頭打ちになる一方、帯域と保存容量の負担は増え続けます。圧縮も解像度と同程度に重要です。
- 顔認識カメラはどの高さに設置すべきですか。
- 対象となる人々の目の高さ付近、立位の成人でおおむね1.5〜1.8メートルで、俯角は15度以内に抑えます。高所に設置して急な角度で見下ろす配置が最も多い誤りです。顔ではなく頭頂部を写すことになります。
- 既設のCCTVカメラを顔認識に使えますか。
- 使える場合もあります。既設カメラは通常、顔の撮影ではなく場面の把握のために設置されており、高所、広角、俯角という認識に必要な条件の逆になっています。可否は実際の撮影地点における顔の実測画素数、角度、照明で決まります。どちらとも決めつけず、測定してください。
- 建物の出入口で顔認識が失敗するのはなぜですか。
- 多くは逆光です。被写体の背後にガラスの出入口があると、カメラは明るい屋外に露出を合わせ、顔は情報の取り出せないシルエットになります。カメラを建物の内側に向ける、あるいは前方から補助光を当てることが、アルゴリズムの変更よりも多くの出入口を救います。
- 顔認識には4Kカメラのほうが1080pより適していますか。
- 必ずしもそうではありません。重要なのはセンサーの画素数ではなく、顔にかかる画素数です。広いコンコースを写す4Kカメラは、出入口を写す1080pカメラより顔あたりの有効画素が少ないことがあり、4K映像への強い圧縮は照合が依存する微細なテクスチャを失わせます。
- カメラの設置は精度の数値にどう影響しますか。
- 精度の数値が現場間で持ち越せなくなる程度に影響します。被写体が既知の距離で立ち止まり正面を向くゲートと、斜めに歩いて通過する通路とでは、同じアルゴリズムでもまったく異なる結果になります。Ayonixが単一の精度の数値を公表せず、お客様のカメラで試験導入を行う理由がこれです。
