0代码训练GPT-5？MIT和微软证实GPT-4涌现自我纠错能力，智能体循环根据反馈让代码迭代！

转载

1085 天前

3896

智能派

文章转载来源：智能派

原文来源：新智元

图片来源：由无界 AI‌ 生成

我们都知道，大模型具有自省能力，可以对写出的代码进行自我纠错。

这种自我修复背后的机制，究竟是怎样运作的？

对代码为什么是错误的，模型在多大程度上能提供准确反馈？

近日，MIT和微软的学者发现，在GPT-4和GPT-3.5之中，只有GPT-4表现出了有效的自修复。并且，GPT-4甚至还能对GPT-3.5生成的程序提供反馈。

论文地址：https://arxiv.org/pdf/2306.09896.pdf

英伟达科学家Jim Fan强烈推荐了这项研究。

在他看来，即使是最专业的人类程序员也无法一次性正确编写程序。他们需要查看执行结果，推理出问题所在，给出修复措施，反复尝试。这是一个智能体循环：根据环境反馈迭代改进代码。

很有可能，OpenAI正在通过雇佣大量软件工程师来训练下一代GPT。而他们不需要输出代码——Critique is all you need。

- GPT-4能够进行自我修复的核心原因是其强大的反馈能力。它能够有效地自我反思代码的问题所在，其他模型无法与之竞争。

- 反馈模型和代码生成模型不必相同。事实上，反馈模型是瓶颈。

- 基于GPT-4的反馈，GPT-3.5能够编写更好的代码。

- 基于专业人员的反馈，GPT-4本身能够编写更好的代码。

揭秘用于代码生成GPT修复

我们都知道，大语言模型在生成代码方面，表现出了非凡的能力。

然而，在具有挑战性的编程任务（比如竞赛和软件工程师的面试）中，它们却完成得并不好。

好在，很多模型会通过一种自修复工作流来「自省」，来自我纠正代码中的错误。

研究者很希望知道，这些模型在多大程度上能提供正确的反馈，并且说明自己生成的代码为什么是错误的。

如图显示的是，基于自我修复方法的经典工作流程。

首先，给定一个规范，从代码生成模型中采样一个程序，然后在规范中提供的一组单元测试上执行该程序。

如果程序在任何单元测试中失败，那么错误的消息和程序会被提供给一个反馈生成模型，该模型再输出代码失败原因的简短解释。

最后，反馈被传递给一个修复模型，该模型生成程序的一个固定版本。

表面上看，这个工作流似乎非常完美。它让系统在解码过程中克服由于不良样本引起的错误，在修复阶段容易地合并来自符号系统（编译器、静态分析工具和执行引擎等）的反馈。

并且模仿人类软件工程师编写代码的试错方式。

然而，工作流有一个问题：自修复需要对模型进行更多的调用，从而增加了计算成本。

而且，研究者们发现了一个很有意思的现象：大模型自修复的有效性不仅取决于模型生成代码的能力，还取决于它对于代码如何在任务中犯错的识别能力。

目前还没有任何工作对此进行详细调查，因此，作者们研究了GPT-3.5和GPT-4在解决竞赛级代码生成任务时的自修复有效性。

研究人员提出了一个新的评估策略，称为

，在这个策略中，根据从模型中采样的token总数来衡量任务的通过率。

因为使用的是pass@t，而不是传统的pass@k（根据实验数量衡量通过率），这样就能与纯粹基于采样的方法进行公平的比较。

从实验中，研究者发现：

1. GPT-4才能实现自我修复带来的性能提升；对于GPT-3.5，在所有预算下，修复后的通过率要低于或等于基准的无修复方法。

2. 即使对于GPT-4模型，性能提升也最多只能算是适度的（在预算为7000个token的情况下，通过率从66％提高到71％，约等于45个独立同分布的GPT-4样本的成本），并且取决于初始程序的多样性足够丰富。

3. 使用GPT-4生成的反馈替换GPT-3.5对错误的解释，可以获得更好的自修复性能，甚至超过基准的无修复GPT-3.5方法（在7000个token下，从50％提高到54％）。

4. 使用人类程序员提供的解释替换GPT-4自己的解释，可以显著改善修复效果，修复并通过测试的程序数量增加了57%。