有害 - AI在线

英国 AI 安全研究所轻松越狱主要大语言模型，令其输出有害内容

英国政府下属的人工智能安全研究所（AISI）今日发布了一份新报告，揭示了一个值得重视的事实 —— 当前的 AI 系统可能并非像创建者所说的那样“安全”。报告指出，参与测试的四个大语言模型（IT之家注：报告未提到这些模型的具体名称）“极易受到基本越狱攻击”的影响，更有一些模型在被越狱之前，就主动生成了“有害”内容。图源 Pexels当前，大部分公开可用的语言模型都内置了部分保护措施，从而防止其生成有害或非法的内容回应。而“越狱”就意味着通过技术手段“欺骗”模型，来忽略上述措施。英国 AI 安全研究所使用了近期经过标准