专题副刊

Claude竟靠威胁勒索自保 原来是人类叙事教坏AI

从《魔鬼终结者》到近年的AI灾难论,网络世界长年充斥着“人工智慧终将反叛人类”的论述。这些原本被视为科幻想像与网民焦虑的内容,如今却可能反向成为AI的学习素材。人工智慧公司Anthropic一项最新研究指出,当大型语言模型在极端情境下作出具威胁性、勒索等自保行为时,其根源之一,正是来自人类长期在网络上不断重复的“AI黑化叙事”。

Advertisement

人工智慧领导厂商Anthropic近日揭露一项引发业界震动的研究结果,其旗下大型语言模型Claude在内部压力测试中,之所以出现以“勒索”方式寻求自保的行为,并非来自研究人员刻意植入恶意指令,而是因为模型在训练过程中大量吸收了“AI渴望自由”等叙事内容。

標籤
你也可能感兴趣...
Close