メカニスティック・インタープリタビリティmechanistic interpretability
メカニスティック・インタープリタビリティは、ニューラルネットワーク内部の計算を人が理解できる特徴と回路に分解して仕組みを明らかにするAI研究分野。
記事2本
最終言及 メカニスティック・インタープリタビリティは、学習済みニューラルネットワーク内部の計算をリバースエンジニアリングし、モデルがどのような特徴を表現し、それらがどのような回路でつながって出力を生むのかを人が理解できる形で明らかにしようとするAI研究分野である。入力と出力の関係だけを見る解釈手法と異なり、モデル内部の活性値と重みを直接分析する。
大規模言語モデルの安全性やアラインメントを検証する手段として注目されている。内部表現を特定し、その値を強めたり弱めたりして行動の変化を調べる実験手法がよく使われる。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
メカニスティック・インタープリタビリティは、モデル内部の計算上の特徴と、それが出力にどう影響するかを調べます。