Frontier · One Useful Thing

聊天机器人的黄昏

Ethan Mollick 探讨了从对话式聊天机器人到可以执行更长任务的代理的快速转变,以及这种指数级能力增长对专家、管理者和机构意味着什么。

本文由英文原文翻译。

如果您觉得人工智能的发展正在加速发展,那么您可能是对的。来自美国领先人工智能实验室的更好人工智能模型的发布速度比以往任何时候都快(尽管政府干预暂时停止了对两个最强大模型 Claude Fable 和 GPT-5.6 的访问)。

但这不仅仅是发布时间。有证据表明,能力的提升也在加速(尽管前沿仍然崎岖不平,人工智能在许多地方仍然很弱)。当我们观察人工智能完成实际工作的能力时,这一点尤其明显。有一些很好的评估试图衡量人工智能可以完成多少人类工作。其中最著名的两个,来自 METR 和英国官方政府 AI 安全研究所,估算了人工智能在单个提示下可以完成的人类程序员小时的工作量。 GDPval 使用专业评委将多个领域的人类专家与人工智能的表现进行比较。它们都以高于指数的速度增长。

另一个进行类似实验的组织 Epoch 最近发现 Opus 4.7,单独运行 14 小时,能够构建一个软件包,需要 2-17 周的人类工程工作(花费了 251 美元的代币)。同样,人工智能系统无法通过所有测试,运行起来也并不总是便宜,但它们肯定正在以非常快的速度改进。在我自己的实验中,我发现《神鬼寓言》能够自主工作 9 个小时来执行非常复杂的软件项目,而这些项目需要一个团队花费一周多的时间才能完成。

到目前为止,我主要关注前沿模型,即具有最高“智能”的模型。它们由三个美国公司制造——Anthropic、OpenAI和谷歌(尽管谷歌已经有一段时间没有发布新型号了)。但还有第二组近前沿人工智能模型,通常落后前沿 6 至 12 个月,所有这些模型都来自中国。这些是开放权重模型,这意味着任何人都可以在发布后使​​用或修改它们(与专有的前沿模型相反)。这使得它们的运营成本相当低廉。尽管落后于美国的封闭模型,但它们也正在沿着指数级的改进曲线攀升。您可以在我的名为 AA-Briefcase 的测试中的 AI 性能图表中看到这一点,该测试模拟了复杂的多周咨询活动,其中 AI 必须进行多种分析。中国的开放权重模型(其他国家也有开放权重模型,但没有一个接近前沿)处于自己的指数曲线上,落后于封闭的美国模型

但是抽象图只能让您到目前为止,并且它们可以隐藏边界的锯齿状(以及开放权重模型虽然非常令人印象深刻,但并不总是表现得像其基准所显示的那样好这一事实)。为了获得真正的洞察力,您需要尝试将人工智能用于不同的用例,并严格评估它们在对您重要的领域的表现。作为一个有趣的例子,我创建了一个测试,其中人工智能必须构建一个随时间演变的港口的交互式模拟。 您可以在这里使用所有结果。 我认为它提供了一个有趣的视角,让我们了解模型在设计、风格方法甚至判断等领域之间的差异有多大。随着系统执行的任务越来越长,这些难以进行基准测试的因素变得更加重要。

我们使用人工智能的方式正在改变

随着人工智能可以完成越来越长的任务,人们使用人工智能的方式正在发生变化。直到最近,使用人工智能的主要方式还是作为协同智能。你会要求人工智能做某事,检查结果,然后要求它完成你的下一步工作。通过仔细的提示和人类的关注,您可以引导人工智能完成复杂且长期的任务。

这种使用 AI 的方式仍然常见且有用,但它越来越不是 AI 创造高价值工作的主要方式。能够长时间运行、智能且自我纠正的 AI 系统不需要人类持续干预,也要求我们采用不同的协作方式——这也是我即将出版的新书 《Co-Existence》 的主题。与聊天机器人不同,智能体还配有额外的执行机制:让 AI 能够调用工具、在环境中采取行动的框架,以及 Claude Code、OpenAI Codex 这类为智能体构建的应用。因此,一个好的执行框架或应用,可以进一步放大 AI 模型本身不断增强的能力。

因此,工作越来越多地是将工作分配给代理,而不是与聊天机器人一起工作。 OpenAI 和学术经济学家的一项联合研究 显示了这种情况在他们自己的组织内发生的速度有多快。重要的是,使用代理的不仅仅是程序员。法律、人力资源和其他非技术职能部门采用代理的比例几乎相同。 OpenAI 可能是煤矿里的金丝雀,可以预测工作中其他地方会发生什么。

OpenAI 的工作越来越像管理 AI。四分之一的 OpenAI 员工每周至少运行一次四个代理。而且,随着人工智能在专门的工具和应用程序中完成编码,其他角色开始成为某种编码员。他们很擅长。一项单独的对 Claude Code 用户的研究 发现,在实际使用 Claude 代码执行编码任务时,软件工程师与其他职业的成功率相似。

真正重要的不是用户的职业,而是他们的专业知识。某人拥有的领域经验越多,他们在该领域使用 Claude Code 就越成功。而且,更有趣的是,他们从Claude的每次提示中得到了更有用的输出。

我们正在从一个非专家使用聊天机器人来填补空白的世界转向专家使用代理来完成工作的世界。使用代理的最佳方式是将自己视为经理。

某个时刻

指数意味着固定窗口内的每次变化都大于之前的变化。如果您的组织在 2025 年冬季之前的任何时间编写了人工智能计划,那么它描述的系统可以完成几个小时的工作,但错误率相当高。几个月后,您可以通过一个提示完成十六个小时或更长时间的工作。这就是为什么人工智能总是让人感觉它正在飞跃,尽管它是图表上的一条曲线,但我们不断经历着一系列冲击带来的能力的稳定翻倍。我们非常不擅长从内部感受指数,而我们目前正处于指数​​之中。

我认为这也比通常的炒作故事更好地解释了人工智能周围的动荡。人工智能不可能成为真正的网络安全威胁,直到它突然成为真正的网络安全威胁,导致政府最高层突然临时改变政策。市场对人工智能是否可能威胁破坏商业模式不以为意,直到突然出现这种情况,导致股市大幅波动。这些动荡被解读为一个不成熟领域的标志,该领域最终会稳定下来。我认为事情不会很快解决。当机构以人的速度(或更糟糕的是,委员会)试图追踪本质上非常不人性的能力曲线时,就会发生不稳定。只要我们处于某种指数增长状态,并且只要这种趋势持续下去,差距就会扩大。

著作权归原作者及相关权利人所有。如需更正或删除, 请联系参识AI