机制可解释性mechanistic interpretability
机制可解释性是将神经网络内部计算拆解为人类可理解的特征和回路、以揭示其工作原理的AI研究领域。
2篇文章
最近提及 机制可解释性是一个AI研究领域,通过对训练好的神经网络进行逆向工程,以人类可理解的方式揭示模型表征了哪些特征,以及这些特征如何经由回路组合产生输出。与只关注输入和输出关系的解释方法不同,它直接分析模型内部的激活值和权重。
该领域作为检验大语言模型安全性与对齐的手段而受到关注。常见的实验方法是找到某种内部表征,再增强或减弱其数值,观察行为的变化。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
机制可解释性研究模型内部的计算特征及其如何影响输出。