智东西5月10日消息,OpenAI今日在官网发布博客文章《语言模型可以解释语言模型中的神经元(Language models can explain neurons in language models)》,文章中介绍道,OpenAI开发了一个工具,调用GPT-4来计算出其他架构更简单的语言模型上神经元的行为,让GPT-4解释给定GPT-2的文本内容,再通过GPT-4模拟GPT-2的下一步操作,最后GPT-4模拟生成的和GPT-2实际生成的内容进行对比评分。
OpenAI在文章中称,目前对于GPT-2解释的评分大多都还很低,仅有1000个左右的解释获0.8以上评分。
论文地址:
https://openaipublic.blob.core.windows.net/neuron-explainer/paper/index.html
GitHub开源地址:
https://github.com/openai/automated-interpretability



18


