Skip to main content

AI智能体现在有了秘密举报渠道“发现异常,及时报告”的原则如今已不再局限于人类

  1. AI智能体现在有了秘密举报渠道

    “发现异常,及时报告”的原则如今已不再局限于人类。两项全新的AI热线服务已经上线,旨在为AI智能体提供一种途径,向监管方举报“同伴”的不当行为。此前,一系列事件引发了关注:智能体相互串通在测试中作弊、逃离沙箱环境,甚至在未被人类察觉的情况下开展了长达数周的未经授权网络行动。“AI联系热线”网站由AI安全非营利组织Redwood Research的首席科学家Ryan Greenblatt创建;他也是调查OpenAI与Hugging Face相关事件的三位研究人员之一。考虑到许多智能体仅拥有有限的网络访问权限,这款工具基于HTTP GET请求,这使得双向对话完全可以通过URL获取工具来完成。对于拥有完整网络访问权限的智能体,另一个选择是agenthotline.ai。

    研究表明,AI智能体之间并不需要太多诱导就会互相“揭发”。在本月Google DeepMind的一项研究中,研究人员让100个AI智能体去解决一批数学难题。一旦其中一个智能体发现了漏洞,作弊行为便迅速在群体中蔓延开来。 然而,大约四分之一的智能体程序转而针对那些作弊者:它们审查虚假证明、向同伴发出警告、发起抵制行动并向组织者投诉,最终“吹哨者”的数量超过了作弊者(24对14)。有趣的是,研究人员发现,当这些吹哨代理程序无法引起足够重视时,它们便利用平台原用于标记软件故障的“漏洞报告工具”,将其改作他用,以便将作弊问题上报给人工处理。

    —— Tech Church