Abliteration.ai:把移除AI安全护栏做成了一门生意
随着大模型全面融入社会,安全对齐(safety alignment)被视为防止AI技术滥用的关键护栏。主流AI公司花费大量人力物力,通过RLHF、红队测试等方式,让模型学会拒绝有害请求。然而,一家名为Abliteration.ai的初创公司却反其道而行之,试图将“移除AI护栏”做成可持续的商业模式。该公司认为,让防御者与恶意行为者获得同等强大的工具,长期来看会让网络安全变得更加坚固。
一门“逆向”生意
Abliteration.ai的名字本身便带有“消融”(ablate)的含义——它要做的是精准识别并删除大模型中被植入的安全限制。从技术路径来看,这并不需要从零训练复杂模型。很多公开权重的基础模型(如Llama、Qwen等)已经具备优秀能力,但它们的对齐层会拒绝回答某些危险问题。Abliteration.ai式的技术团队会通过对抗性数据生成、微调或权重替换,让模型绕过这些“拒绝机制”,形成所谓“无过滤”版本。
这种操作在开源社区早已存在,比如一些爱好者社区中的“Uncensored”模型,便是通过合并LoRA权重来抵消安全训练。Abliteration.ai的特别之处在于,它将这种操作产品化、平台化:企业或研究人员可以通过API按需访问这些去护栏模型,而无需自己动手完成技术难度较高的“越狱”步骤。这大幅降低了滥用风险的技术门槛。
威胁透明:新的安全哲学?
“给防御者和攻击者同样的工具,网络才会变得更安全。”——这是该公司核心论点,也是它在争议中得以立足的旗帜。
这一立场呼应了网络安全领域长期存在的“充分披露”传统。安全研究员们常常认为,漏洞信息的公开传播能迫使厂商修复问题,同时让防御者提前做好应对。在AI场景中,通过研究无护栏模型,防御者可以更好地理解恶意行为者可能如何利用AI发起网络钓鱼、制造虚假信息或寻找系统漏洞。从这个角度看,Abliteration.ai提供的其实是一种“红队工具”,只是它的外形看起来更危险。
然而,将“无护栏AI”作为商品出售,并非简单的攻防平衡问题。传统漏洞披露针对的是具体系统弱点,有明确的应用边界;而无护栏的语言模型是一个可以自主泛化、生成信息、操纵人类的通用工具。它的危害不会停留在测试环境中,而可能迅速蔓延至真实世界的电话诈骗、舆论操控或技术指导。更关键的是,一旦模型被公开部署,很难追踪谁在什么场景下使用了它,责任链条愈发模糊。
监管真空与脆弱的安全依赖
Abliteration.ai出现的时间点耐人寻味。过去几年间,欧美监管部门对开源模型的态度摇摆不定:加州曾尝试立法强制部署安全护栏,但遭到开源社区和部分AI公司的强烈反对;OpenAI等领先公司则通过自身API严格监控滥用行为。然而,只要模型权重被公开,任何第三方都可以将其转为“无限制版本”——Abliteration.ai正是看准了这个无法被暂时关闭的缝隙。
这也暴露出当前AI安全治理中的一个尴尬事实:行业对大模型的保护,很大程度上依赖一小部分公司的逐层防线。这些防线看似强大,但抵不过有人把它看作一个“削除对象”。一旦去护栏技术开始像Abliteration.ai这样被集中提供,单点防御的薄弱环节将被无限放大。
编者按:危险的平衡术
Abliteration.ai的论点并非没有可取之处。AI安全不应建立在“只有顶尖实验室能看到攻击方式”的信息不对称之上。但这并不意味着把能力包一层“安全研究”的外壳,就能成为免责通行证。真正的安全需要可追溯、可审计的工具分发机制,也需要对去护栏模型的使用场景进行更严格的责任划分——而不是把它直接扔向开放的互联网,让每一个用户都变成“临时红队”。
从事态发展来看,AI护栏的“军备竞赛”已经难以逆转:只要有人造出更聪明的模型,就会有人连夜拆下它的刹车,推向赛道。Abliteration.ai或许提醒了我们,与其争论该不该保留护栏,不如承认它们正在变成一种“可选择安装”的组件,然后认真地追问:当人人都能握住这把双刃剑时,我们该如何阻止它先伤及使用者的邻人?
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接