安 全
Safety & Alignment
负责任的人工智能不是可选项,而是基石。
我们的方法
在 Wyrmlabs,安全不是事后考虑——它嵌入在我们开发流程的每个阶段。从预训练数据筛选到部署后监控,我们坚持严格的标准,确保负责任的人工智能开发。我们的安全框架借鉴了对齐、可解释性和对抗鲁棒性方面的前沿研究。
红队测试
每次 Fathom 发布都经过内部安全团队和外部合作伙伴 500 小时以上的对抗性测试。我们的红队流程涵盖越狱尝试、提示注入、偏见利用和边缘案例推理失败。外部研究人员受邀参与我们的协调披露计划。
负责任的扩展政策
Wyrmlabs 采用基于 ASL(AI 安全级别)标准的分层负责任的扩展政策。目前运行在 ASL-2 级别,我们的 RSP 包括触发额外安全措施的能力阈值:ASL-2 自动红队测试,ASL-3 独立审计,以及更高级别的特定能力隔离协议。
偏见与公平性
我们跨人口统计维度、语言和使用场景评估 Fathom,以识别和缓解偏见。我们的公平性基准包括 BBQ、WinoBias 的翻译版本以及针对中文语境的自定义评估。我们随每次模型发布同时发布偏见审计结果。
