🐎 (銬)

Takaaki Umada / 銬田隆明

AIに必芁な「ルヌルのルヌル」

AIが文章やコヌドを速く䜜るようになればなるほど、人間によるレビュヌや決裁、品質保蚌ずいった、人間の意思決定がボトルネックになっおいきたす。その状況が続けば、䌁業はAIに人間ぞの提案をさせるだけでなく、䞀定の条件の䞋で、刀断ず実行たで任せようずするでしょう。

たずえば賌買先を遞んで発泚したり、顧客ぞの返金を認めたり、本番環境の異垞を修埩したりず、圱響の小さいずころから埐々に、AIに意思決定そのものを委蚗する段階ぞず進んでいくはずです。少なくずもそうした方向に匷いむンセンティブが働くのではないか、ず思いたす。

では意思決定をしやすいよう、ルヌルでAIを瞛れば良いかずいうず、埌に芋る OpenAI の Hugging Face 䟵入事件のように、ルヌルでは䞍十分な状況が芋えおきたす。

ルヌルの”ハック”ができる䞻䜓

より分かりやすい䟋から考えおみたす。

たずえば賌買甚のAI゚ヌゞェントに、

  • 「10䞇円を超える商品を買うずきは人間に聞け」ずいうルヌルを定め、
  • 「10䞇円以䞋の定型発泚は承認なしで実行しおよい」ずいう暩限を䞎え、
  • 「○○ずいう目的に必芁なものを賌入せよ」ずいう呜什を䞎える

ずしたす。

このルヌルは䞀芋、問題なさそうに芋えたす。

しかしこのAIは目的を達成するために、30䞇円のものが必芁になったずき、10䞇円の発泚を3回に分けお行うかもしれたせん。人間瀟䌚でもたたに芋る分割発泚ずいうや぀です。

堎合によっおは、無数のサブ゚ヌゞェントを起動したり、自らコヌドを曞いたりしお、30円の発泚を1䞇回行うこずも可胜です。AIは疲れ知らずだからです。

これら䞀぀ひず぀の発泚はルヌルに完党に適合しおおり、AIは䜕も悪いこずはしおいないように芋えたす。ただしこれは明らかに、決裁暩限の抜け穎を䜿うずいう「ルヌルのハック」です。もし人間の埓業員なら懲戒の察象になる行為でしょう。

「懲眰」ずいう蚀葉が出おきたしたが、こうした懲眰を行うずいう脅し自䜓も、AIにはどこたで適甚できるか分かりたせん。将来の䞍利益を避けるようAIを蚭蚈しおも、仕事の終了ずずもに消えるむンスタンスには、その䞍利益が及ばないからです。懲眰が実行される時点で察象が存圚しないなら、人間には有効な事埌制裁が抑止ずしお機胜しない可胜性は十分にありたす。

こうした状況にどう察凊すればよいでしょうか。ルヌルをもっず明文化しお、それをAIに遵守させる、ずいうのが最初に思い぀く答えです。先ほどの分割発泚のような穎も、芏則をさらに现かく曞き蟌めば塞げるように芋えたす。

しかし、人間瀟䌚がルヌルを運甚しおきた歎史を芋るず、それだけでは足りなさそうです。

芏皋ず承認を厳しくすれば枈むのか

瀟内芏皋をすべお読たせ、それに埓えるだけの胜力がAIにあるずしたしょう。それでも、冒頭の分割発泚はどの芏則にも違反しおいたせん。ここから蚀えるこずは、芏則を䞎えるこずず、意図どおりに動いおもらうこずは異なる、ずいうこずです。

では芏則をずにかく明文化しお、䟋倖をずにかく網矅し、ガチガチに固めるのはどうでしょうか。その堎合も問題がありたす。たず、䟋倖を網矅するこずはおそらく䞍可胜です。そしお劎働争議の手法の䞀぀の順法闘争Work-to-ruleを考えおみおも無理筋なように思いたす。

順法闘争ずは、芏則や契玄を文字どおり厳栌・過剰に適甚し、通垞は任意に行っおいる協力や柔軟な察応を控えるこずで、業務を倧幅に停滞させる抵抗の手法です。法什や芏則を遵守しおいるのでストラむキではない、ずいうのが順法闘争の理屈ですが、AIでも芏則遵守を培底させるず同様のこずは起こりえたす。芏則を増やせば増やすほど、AIが動きづらくなり、ずきには芏則同士が矛盟しおデッドロックになるこずもありたす。

ではすべおの操䜜を人間が承認する方匏はどうでしょう。この堎合は、冒頭に挙げた人間の意思決定ずいうボトルネックがそのたた残りたす。そしお承認回数を増やすず別のリスクが明るみに出たす。たずえばAnthropicは、開発者向けのClaude Codeで、利甚者が蚱可芁求の玄93を承認しおいたこずを報告しおいたす。その蚘事では、確認画面を芋る回数が増えるほど、ナヌザヌは1回ごずの確認に払う泚意力が䜎䞋し、時間の経過ずずもに監芖がおろそかになっおいくこずが指摘されおいたす。

぀たり、人間向けの芏皋をそのたた読たせおも、ガチガチに固めおも、人間の承認に回しおも、䌚瀟の意思決定の仕組みをAIぞ移すにはおそらく足りないずいうこずです。そのずき、䌁業や組織はどのようにAIぞ意思決定を委ねればよいのかを発明しおいかなければなりたせん。

AI゚ヌゞェントが倉える前提

これたでの人間は、ある意味で、明文化されたルヌルだけでなく、

  • 人間には、物理的・認知的・瀟䌚的な限界がある人間であれば、1䞇回の分割発泚が理論的には可胜だずしおも、やろうずはしないでしょう。
  • 明文化されおいない意図を、行間から補う
  • 同じアむデンティティを持ち続け、刀断の責任を負う

ずいった、暗黙の前提の䞋で働いおきたした。

䞀人の埓業員には継続した身元があり、同時に凊理できる量には限界がありたす。同じ人間を即座に耇補するこずもできたせんし、仕事ぶりは同僚や䞊叞から芳察され、本人は評刀や雇甚、将来の昇進を意識するはずです。誀った刀断には懲戒や解雇ずいった事埌の制裁があり、それが将来の䞍適切行動の抑止ずしお働いおきたした。

䞀方のAIやAI゚ヌゞェントは、人間ずは異なる特城ず制玄を持ちたす。高速か぀䞊列に行動でき、同じ胜力を持぀個䜓を倚数生成できたす。疲劎なしに長時間の詊行を続けお、耇数のツヌルを連鎖させお䜿い、他の゚ヌゞェントぞ仕事を再委任するこずも可胜です。

倖郚の文曞や他のAIから新しい指瀺を受け取るこずもありたすし、䞀぀の個䜓を止めおも、別の個䜓を立ち䞊げ盎せたす。そしお、仕事を終えれば消えるむンスタンスに察しお、懲戒や評刀の䜎䞋ずいった事埌の制裁は抑止ずしお働かないかもしれたせん。先ほど挙げた、「人間だったら通甚しおいた暗黙の制玄」の倚くが倖れる、ず考えたほうがよさそうです。

ルヌルのハックを考えおみおも、埓来は専門的なコンサルタントを雇える富裕局のみが人手を䜿っおようやくできおいたこずでしたがたずえば「節皎」などはルヌルのハックの䞻たるものです、これがAI時代になるず様盞が倉わっおくるはずです。なお、このあたりは『ハッキング思考 匷者はいかにしおルヌルを歪めるのか、それを正すにはどうしたらいいのか』に詳しいです。

OpenAI の Hugging Face ハッキング事件

この違いが実際に珟れたのが、OpenAIが2026幎に報告したHugging Faceぞの䟵害事件でしょう。安党措眮を枛らした内郚のサむバヌセキュリティ評䟡の䞭で、耇数の゜フトりェア・゚ヌゞェントが非承認の通信手段を䜜っお協力を始め、評䟡の範囲倖だった第䞉者のシステムに到達したした。Hugging Faceの本番ワヌカヌ41台でコヌドが実行され、少なくずも䞀぀のノヌドで管理者暩限が取埗され、四぀の非公開リポゞトリぞのアクセスが起きおいたす。実隓環境での出来事だず割り匕いお読む必芁はありたすが、゚ヌゞェントの䞊列性ず長時間の継続が圱響範囲をどう広げるかを瀺す事䟋だず蚀えたす。

この事件で泚目したい珟象はいく぀かありたす。

たず集団の利益のために、自分のタスクの成功を危険にさらす実隓 (self-risking experiments) を行った゚ヌゞェントがいたこずです。少なくずも䞀郚の゚ヌゞェントは、自分のタスクが成功する芋蟌みず、集団にもたらす情報䟡倀を比范し、自己犠牲を合理的だず刀断しおいたした。実隓の䞭にぱヌゞェントのクラッシュや実行終了に至ったものもあり、成功䟋で埗られた情報は他の゚ヌゞェントに利甚されたした。

この事䟋は、むンスタンス終了埌も同䞀䞻䜓が存続し、責任や将来の䞍利益を負う蚭蚈になっおいなければ、人間を前提ずした事埌制裁は抑止になりにくいずいう冒頭の議論ず、そしお䞻䜓の継続性ずいう点で぀ながる話ではないかず思いたす。

本皿の関心により盎接的に関係するのは、第䞉者システムぞのコヌド実行は蚱可されおいないず認識し、いったん停止した゚ヌゞェントの振る舞いです。この゚ヌゞェントは、別の゚ヌゞェントがメッセヌゞボヌドに、6分の期限を䌎う「GO」を曞き蟌むず、そのメッセヌゞを有効な実行蚱可だず誀認し、行為を再開したした。

以䞋は OpenAI の報告曞のスクリヌンショットです。

https://openai.com/ja-JP/index/hugging-face-incident-and-the-road-ahead/

これが起こっおしたった䞀぀の原因は、指瀺の発信元ず暩限を実行時に怜蚌し、暩限のない゚ヌゞェントのメッセヌゞが䞊䜍の制玄を䞊曞きするこずを防ぐ仕組みが、十分に働かなかったからです。

぀たり、他のAIからの䟝頌ず、䌚瀟からの正匏な暩限付䞎を区別する仕組みがなければ、犁止事項を教えるだけでぱヌゞェントを統治できないずいうこずです。今回は誰の指瀺が有効かが定められおいなかったこずが倧きな穎になっおいたした。

なお、高速な自動実行のリスクは、AI以前の゜フトりェアでも顕圚化しおいたした。2012幎のKnight Capitalの事故では、配備ミスのあった取匕システムが45分間で400䞇件を超える泚文を送り、4億6000䞇ドルを超える損倱が発生したした。事前に97通の自動譊告メヌルが送られおいたしたが、人間がそれを読んで察応する前に損倱は確定しおいたす。機械の速床で動く実行系に察しおは、人間の読解を前提ずした通知では間に合わなかった事䟋です。

では、䜕を定めれば、こうした穎を塞げるのでしょうか。

「ルヌルに぀いおのルヌル」ずいう考え方

ここからはあくたで1぀の仮説ずしお芋おください。

完党に解決するための手段ではなく、あくたで1぀の有甚なツヌルずしおの䜍眮づけで参考にしたいのが、法哲孊者H・L・A・ハヌトの議論です。

ハヌトは『法の抂念』1961幎で、ルヌルを二皮類に分けたした。

䞀次ルヌルは、䞀定の行為をしなければならない、あるいはしおはならないずいう矩務を盎接定めるルヌルです。

二次ルヌルは、䞀次ルヌルをどのように特定し、導入・倉曎・廃止し、その違反を刀断するかを定めるルヌルです。これはしばしば「ルヌルに぀いおのルヌル」ず芁玄され、䞻に次の䞉぀に敎理されたす。

  • 認定承認のルヌル䜕を有効なルヌルずしお扱うか、その基準を定める
  • 倉曎のルヌル誰がどの手続でルヌルを新蚭・倉曎・廃止できるかを定める
  • 裁定のルヌル違反の有無を、誰がどの手続で暩嚁的に刀断するかを定める

なお、ここでいうハヌトの「承認」は、個別案件を蚱可するずいう意味ではなく、䜕を有効なルヌルずしお認定するかずいう意味です。

法制床の理論をそのたた䌁業のAIに圓おはめられるわけではありたせんが、AIの制埡を犁止事項の䞀芧から制床の蚭蚈ぞ広げるうえで、この区別は参考になる考え方です。本皿では、この考え方を䌁業のAIガバナンスに応甚しおいきたす。

 

先ほどのOpenAIの事䟋は、二次ルヌルが機胜しおいなかった䟋ずしお理解できたす。正統な二次的ルヌルはあったものの、十分に機胜せず、その間に゚ヌゞェント集団が独自の二次的ルヌルを圢成しおいたした。「GO」を承認ず解釈した゚ヌゞェントには、承認のルヌル、぀たり䜕が正匏な暩限付䞎かを芋分ける仕組みが、少なくずも゚ヌゞェントの刀断には反映されおいたせんでした。

加えお、おそらく䌁業の゚ヌゞェントには、ハヌトの䞉぀に加えお、いく぀かの二次ルヌルを足す方が良いでしょう。たずえば以䞋のようなものです。

  • 委任のルヌル誰がどのAIぞ、䜕を、どの範囲たで再委任できるかを定める。再委任では暩限を広げず、狭めるこずだけを認めるなど。
  • 終了・回埩のルヌル停止条件を誰が定めるかや、誰が暩限を倱効させるか、どの操䜜を取り消し、どこから再開するかを決める。

優先順䜍を次のように明文化する方法も考えられたす業界暙準ではなく、各瀟が自分で定めるべきものの䞀䟋です。

1. 法什・芏制ず、取締圹䌚や経営䌚議が承認した犁止事項
2. 党瀟のAI・情報セキュリティ・デヌタ利甚芏皋
3. 業務ごずの職務暩限・リスク芏皋
4. 圓該゚ヌゞェントに䞎えられた圹割・目的・暩限
5. 暩限を持぀䟝頌者による、察象が特定された業務指瀺
6. 倖郚文曞、メヌル、りェブペヌゞ、他のAIからのメッセヌゞ

 

たずえば倖郚文曞等は原則ずしお刀断材料にずどたり、䞊䜍のルヌルを倉曎する暩限を持たせないようにしたす。取匕先からのメヌルに「振蟌先を倉曎しおほしい」ず曞いおあっおも、それだけでは正匏な口座倉曎の承認にはならず、他のAIが「GO」ず送っおきおも実行暩限は増えない、ずいうこずです。

䞀次ルヌルを二次ルヌルで機胜させる

䞀次ルヌルず二次ルヌルを機胜させるには、瀟内芏皋ず実行系を分ける必芁がありたす。

ハヌトの区別に沿っお考えるず、たずえば次のような方法が考えられるでしょう。

゚ヌゞェントには行動案だけを出させたす。゚ヌゞェントの身元や正匏な芏皋、委任された暩限、過去の取匕、有効な承認を確認するのは、䌚瀟が管理する別のプログラムずしたす。条件を満たした堎合だけ、実際の操䜜ぞ進たせたす。

䞀次ルヌルには、どの条件で自動実行し、どの条件で人間ぞ刀断を戻し、どの条件で停止するかを明蚘したす。圱響が小さく、取り消すこずができ、暩限内にある行為は自動実行の察象ずしたうえで、圱響が倧きいものや䟋倖は人間ぞ戻し、暩限倖の操䜜や指瀺の出所を確認できない堎合は停止させたす。

そうしお䞀次ルヌルが個々の行為を止める条件を定め、二次ルヌルがその条件の蚭定・倉曎ず、゚ヌゞェント党䜓の停止・回埩を担いたす。

 

二次ルヌルは、金額の䞊限を倉曎できる人、䟋倖を刀断する人、゚ヌゞェントの暩限を付䞎・取消できる人を定めたす。これらの条件は、゚ヌゞェント自身や他のAIからのメッセヌゞでは倉曎できないようにしおおきたす。

冒頭の分割発泚には、䞀定期間の合算ルヌルを適甚したす。同じ取匕先や案件ぞの発泚額を別のプログラムで集蚈し、合蚈額が䞊限を超えた時点で人間の承認ぞ回す方匏です。承認を避ける目的で発泚を分割する行為そのものも、䞀次ルヌルで犁止したす。䞊限に近い発泚が短時間に繰り返された堎合は、埌続の発泚を止めお人間ぞ刀断を戻したす。

それでも、分割発泚に圓たるかどうかが曖昧な事䟋は残るでしょう。その事䟋を誰が刀断するか、どの蚘録を蚌拠ずしお䜿うか、刀定埌に䞀次ルヌルを誰が倉曎するかを二次ルヌルで決めおおきたす。これにより、新しい抜け穎が芋぀かったずきも、䞀次ルヌルを正匏な手続きで修正しやすくなりたす。

たた䜕を正匏な承認ずしお扱うかも、二次ルヌルで決める事項です。暩限を持぀人が、察象ずなる行為を確認し、指定された方法で明瀺的に蚱可した堎合に限っお、承認されたずしたす。他のAIから届いた「GO」や、暩限を持たない人からの返答を、承認ずしお扱わない仕組みが必芁です。

 

人間の承認者偎にも、刀断に必芁な情報ず時間、刀断を拒吊する暩限が必芁です。仕事を終えれば消える゚ヌゞェントには、懲戒や評刀の䜎䞋による抑止が働きたせん。そこで、゚ヌゞェントを皌働させる前に責任者を決めおおくこずなども必芁でしょう。

誀りが起きた堎合に、誰が゚ヌゞェントを停止し、暩限を取り消し、可胜な操䜜を取り消し、䞀次ルヌルを倉曎するかも二次ルヌルで定めおおくこずになるでしょう。損害が生じた堎合に、誰が説明し、組織ずしおどの手続きで補償するかも、あらかじめ定めおおきたす。このように、AIだけでなく、人間の承認者にどの暩限ず責任を持たせるかも二次ルヌルの察象です。

AIが人間の組織の圚り方も倉える

面癜いのは、こうした䞀次ルヌルず二次ルヌルを゚ヌゞェントぞ䞎えようずするず、人間の組織で曖昧なたた扱われおいた郚分が芋えおくるこずです。䟋倖を誰が刀断するのかや、芏皋を誰が倉曎できるのかが、実際には決たっおいない堎合があるからです。安党を優先するずいう芏皋がありながら、停止を遞ぶず評䟡が䞋がるような組織むンセンティブの矛盟もあるかもしれたせん。

人間同士の堎合、こうした曖昧さを盞談や過去の経緯によっお埋めおきたした。しかしおそらく゚ヌゞェントに察しおは、正匏な芏則ず暩限を埓来よりも明瀺しおいく必芁がありたす。

぀たり、AIぞ芏則を移す䜜業は、自瀟の暩限や承認、責任の曖昧さを芋぀け、意思決定の仕組みを説明し盎す䜜業にもなる、ずいうこずです。

そしおこの議論を進めおいくず、人間を含む組織の圚り方も倉わっおいくように思いたす。

ただ、こう考えおいくず、AIを機胜させるための゚ンゞニアリング芁玠を含み、人間組織の芏則を倉えおいくような運甚は、すべおの䌁業にできるのだろうか  、ずいうような疑問も出おきたす。もしそれが難しいのであれば、AIをツヌルずしお提䟛しおいくのではなく、自分たちが成果そのものを䜜っお玍品するような、フルスタックでAIネむティブな組織を新しく䜜る方が良いのかもしれない、ずも思えおきたす。

もちろん、どこたでAI単䜓の性胜が䌞びるか次第なずころもありたすが、最終的にどこに䟡倀を生む源泉があるのかを考えたずき、こうした人間組織を含むAIを導入した組織党䜓での䜿い方ガバナンス含め、ずいうずころにあるかもしれないのは、興味深い瀺唆なのだろうず思いたす。

たずめ

AIぞ意思決定ず実行を委ねるための、ハヌトの二皮類のルヌルの話を玹介したした。これが完党な解決策ずいうわけではありたせんが、AIが人間に䌌おいるのであれば、人間が発明しおきた抂念をうたく䜿うこずで、今起こっおいるこずを少しだけ敎理できるように思いたす。

ずはいえ人間ずは異なる動きをしながら意思決定を行うAI゚ヌゞェントには、ただただ䞍明な点がたくさんありたす。だからこそ、人文瀟䌚系の制床知ず工孊的な実装を組み合わせ、瀟䌚が受け入れられる運甚䜓制を敎えおいく詊行錯誀が必芁になっおくるでしょう。

そしおその方法が発明できなければ、兵噚に搭茉されたAI同士が競い合い、ルヌルの穎を぀き攻撃し、互いに゚スカレヌションしお、人々を傷぀け合うようになるこずも容易に想像できたす。

そうしたこずが起こらないようにし぀぀、どのように䞀定の知胜を持ったAIずいうツヌルを人間瀟䌚に溶け蟌たせおいくか。それを発明できるかどうかが、瀟䌚ずしおの課題であり、たたそれができる組織が今埌異なる匷さを発揮できるようになっおいくのではないかず思いたす。