AI安全(AI safety)
/ AY-EYE SAYF-tee /
AI安全,是一项宽泛的努力:让AI系统行为可靠、避免造成伤害——把它们造得即便强大、有能力、又在真实世界里行动,也不会因失误、滥用,或以意料之外的方式追求目标而酿成损害。若把造AI比作造越来越快的汽车,那么AI安全就涵盖了从刹车、安全带到碰撞测试与交通规则的一切:一门「别被自己造的东西伤到」的学问。
它是一把伞,罩着时间尺度和关切都迥然不同的诸多议题。近期而具体的:模型会信心十足地编造、会泄露隐私数据、会给出危险指示、会吸收偏见,或能被「越狱」诱导去作恶——这些问题此刻就存在,正造成真实的伤害。长远而更具思辨色彩的:确保未来那些有能力得多的系统,仍然可控、仍与人类意图对齐——对齐问题、以及工具性趋同之类的论证,就栖身于此。两端都属于安全的范畴;至于该如何在两者间分配注意力,严肃的人各执一词。
有两种诚实的框定很有帮助。其一,安全并不与能力或进步对立——它恰恰是你「既保住好处、又不出事故」的途径,正如航空安全成全了大众航空旅行,而非阻拦它。其二,对炒作与轻蔑都要提防:「AI会把我们全杀光」与「AI安全不过是用来拖慢对手的幌子」,都是信心十足的过头话。脚踏实地的看法是:AI系统是强大的工具,带着真实而多样的失败模式,而减少这些失败——无论现存还是潜在——是寻常而必要的工程与治理,不是什么花边戏。
在发布一个模型之前,团队会做「红队演练」:让人故意去诱使它产出有害指示、泄露训练数据,或被一段藏在它所读网页里的恶意提示骗到。每一次得手的攻击,都是一个待修的安全缺陷——于是加上拒答、过滤器或各种限制——这就跟软件上线前做安全测试一模一样。
红队演练:在用户(或攻击者)之前,先攻击你自己的模型,把失败找出来。
AI安全不是一场辩论,而是许多场:今天的数据泄露、偏见与越狱,跟假想中的超级智能风险是两码事。把它们混为一谈,只会让各方互相把对方漫画化。两者都值得关注,但它们需要不同的工具,不该被混同。