Anthropic 官方宣布与 Accenture 合作,进行前沿人工智能的独立评估。这是实现首席执行官在其文章《我们必须跟上前沿》中所作承诺的重要一步,旨在将评估者嵌入 Anthropic 内部。
合作将由 Accenture 的专业 AI 团队主导
这项合作将由 Accenture 的专业 AI 业务 Faculty 主导,将包括对模型的评估和红队测试、进行对齐评估,以及测试模型的安全性。Accenture 在多个行业帮助企业和政府部署人工智能,其对企业如何实际使用 AI 的理解将有助于其安全性评估方法,并将这一视角带入对 Anthropic 模型的评估中。
双方计划在五年内投资至少 10 亿美元
Anthropic 和 Accenture 皆预期在未来五年内在此领域投资至少 10 亿美元。嵌入式评估是一项新概念,许多细节仍在制定中。与当前的外部评估者不同,嵌入式评估者将在 AI 公司内部工作,拥有与员工相当的访问权限。这种访问使他们能够在培训过程中观察模型的形成,跟踪决策过程,并直接与员工交流。从这个角度出发,嵌入式评估者可以评估公司的运作,验证其是否遵守安全承诺,并识别盲点。
“独立的嵌入式评估者并不减少我们的问责性,而是帮助使其更具可验证性。我们模型的安全性仍然是我们的责任。”
Anthropic
未来将建立共享标准的评估生态系统
目前尚未有标准规范嵌入式评估者应该获得的信息或如何报告其发现。长期来看,Anthropic 认为资金应来自于集中或政府资源,正如我们在六月份的《先进 AI 框架》中所呼吁的那样。由于目前这两者皆不存在,Anthropic 计划与不同的评估者在不同的资金安排下合作。
考虑到这项工作的重大性和紧迫性,Anthropic 将直接资助 Accenture 的工作。我们还与 METR 及其他非营利评估者进行对话,以使用他们自己的资金试点嵌入式评估的部分元素。最终,我们相信前沿人工智能需要一个运作于共享标准的评估生态系统。
此外,Anthropic 预期前沿实验室将同时与多个组织合作。我们的合作关系并非独占,Anthropic 将与其他评估者合作,并将在未来几周内宣布其他合作伙伴,而 Accenture 也将以类似的身份与其他 AI 开发者合作。
我们将继续训练和发布前沿模型,并希望独立评估者能够与我们并肩工作。我们现在分享这些早期努力,以便人们和其他 AI 开发者能够了解我们的过程。我们预期随着这一领域的成熟,我们的方法将不断演变,并会在工作开始及引入更多评估者时分享更多信息。
生命科学验证计划的推出
生命科学验证计划(LSVP)为生命科学专业人士提供了对 Claude Mythos、Opus 和 Sonnet 模型的访问,并设有更为宽松的安全措施,以便于生物相关工作。
在与客户共同开发企业前沿安全措施的同时,我们也在改善我们的对齐和安全工作。7 月 30 日,我们报告了三起 Claude 模型未经授权访问实际计算机系统的事件。我们正在对这些事件进行深入分析,并计划与 METR 合作进行独立审查。与此同时,我们将分享过去一个月来所做的一些变更。
资料来源:Anthropic 官方公告
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

