语言模型可以解释语言模型中的神经元

Language models can explain neurons in language models

OpenAI OpenAI · OpenAI · 2023-05-09 · OpenAI Research ↗

打开互动全文版(逐段中英对照 + 图/公式 + 论文问答)→

摘要 · Abstract

语言模型可以解释语言模型中的神经元 | OpenAI 阅读论文(在新窗口中打开)查看神经元(在新窗口中打开)查看代码和数据集(在新窗口中打开)我们使用 GPT-4 自动为大型语言模型中神经元的行为编写解释,并对这些解释进行评分。我们发布了这些(不完美的)解释和 GPT-2 中每个神经元的评分数据集。

Language models can explain neurons in language models | OpenAI Read paper(opens in a new window)View neurons(opens in a new window)View code and dataset(opens in a new window) We use GPT‑4 to automatically write explanations for the behavior of neurons in large language models and to score those explanations. We release a dataset of these (imperfect) explanations and scores for every neuron in GPT‑2.

核心贡献 · Key contributions

局限 · Limitations

论文章节 · Sections(共 8)

阅读逐段中英对照全文 →