OpenAI 开发新工具，试图解释语言模型的行为-微咔网

正文概述

IT之家 5 月 10 日消息，语言模型是一种人工智能技术，可以根据给定的文本生成自然语言。OpenAI 的 GPT 系列语言模型是目前先进的代表之一，但IT之家注意到它们也有一个问题：它们的行为很难理解和预测。为了让语言模型更透明和可信，OpenAI 正在开发一种新工具，可以自动识别语言模型中哪些部分对其行为负责，并用自然语言进行解释。

这个工具的原理是利用另一个语言模型（也就是 OpenAI 新的 GPT-4）来分析其他语言模型（比如 OpenAI 自己的 GPT-2）的内部结构。语言模型由许多“神经元”组成，每个神经元都可以观察文本中的某种特定模式，并影响模型下一步的输出。例如，给定一个关于超级英雄的问题（比如“哪些超级英雄有有用的超能力？”），一个“漫威超级英雄神经元”可能会提高模型提到漫威电影中特定超级英雄的概率。

OpenAI 的工具就是利用这种机制来分解模型的各个部分。首先，它会将文本序列输入到被评估的模型中，并等待某个神经元频繁地“激活”。然后，它会将这些高度活跃的神经元“展示”给 GPT-4，并让 GPT-4 生成一个解释。为了确定解释的准确性，它会提供给 GPT-4 一些文本序列，并让它预测或模拟神经元的行为。然后它会将模拟的神经元的行为与实际神经元的行为进行比较。

“通过这种方法，我们基本上可以为每个神经元生成一些初步的自然语言解释，并且还有一个分数来衡量这些解释与实际行为的匹配程度。” OpenAI 可扩展对齐团队负责人 Jeff Wu 说，“我们使用 GPT-4 作为过程的一部分，来生成对神经元在寻找什么的解释，并评估这些解释与它实际做什么的匹配程度。”

研究人员能够为 GPT-2 中所有 307,200 个神经元生成解释，并将它们编译成一个数据集，与工具代玛一起在 GitHub 上以开源形式发布。像这样的工具有朝一日可能被用来改善语言模型的性能，比如减少偏见或有害言论。但他们也承认，在真正有用之前，还有很长的路要走。该工具对大约 1000 个神经元的解释很有信心，这只是总数的一小部分。

有人可能会认为，这个工具实际上是 GPT-4 的广告，因为它需要 GPT-4 才能运行。但 Wu 说，这并不是这个工具的目的，它使用 GPT-4 只是“偶然”的，而且，相反它显示了 GPT-4 在这方面的弱点。他还说，它并不是为了商业应用而创建的，并且理论上可以适应除了 GPT-4 之外的其他语言模型。

“大多数解释的分数都很低，或者没有解释太多实际神经元的行为。” Wu 说，“很多神经元的活动方式很难说清楚 —— 比如它们在五六种不同的东西上激活，但没有明显的模式。有时候有明显的模式，但 GPT-4 却无法找到。”

更不用说更复杂、更新、更大的模型，或者可以浏览网页获取信息的模型了。但对于后者，Wu 认为，浏览网页不会太改变工具的基本机制。他说，它只需要稍微调整一下，就可以弄清楚神经元为什么决定进行某些搜索引擎查询或访问特定网站。

“我们希望这将开辟一个有前途的途径，来以一种自动化的方式解决可解释性问题，让其他人可以建立在上面并做出贡献。” Wu 说，“我们希望我们真的能够对这些模型的行为有好的解释。”

以上就是【OpenAI 开发新工具，试图解释语言模型的行为】的相关内容，查看其它ai资讯请关注微咔网

根据二〇〇二年一月一日《计算机软件保护条例》第十七条规定：为了学习和研究软件内含的设计思想和原理，通过安装、显示、传输或者存储软件等方式使用软件的，可以不经软件著作权人许可，不向其支付报酬。

本网站所有发布的源码、软件和资料，均为作者提供或网友推荐收集各大资源网站整理而来，仅供功能验证和学习研究使用。

所有资源的文字介绍均为网络转载，本站不保证相关内容真实可信，同时不保证所有资源100%无错可用，也不提供相应的技术支持，介意勿下。

您必须在下载后24小时内删除，不得用于非法商业用途，不得违反国家法律，一切关于该资源的商业行为与本站无关。

如果您喜欢该程序，请支持正版源码，得到更好的正版服务。、如有侵犯你的版合法权益，请邮件与我们联系处理【投诉/建议发送至邮箱：3066548754@qq.com】，本站将立即改正并删除。

本声明为本站所有资源最终声明，所有与本声明不符的表述均以本声明内容为准。

微咔网 » OpenAI 开发新工具，试图解释语言模型的行为