Fathom-1.0 已发布阅读公告 →
Wyrmlabs
WYRMLABS智 能 实 验 室

安 全

Safety & Alignment

负责任的人工智能不是可选项,而是基石。

我们的方法

在 Wyrmlabs,安全不是事后考虑——它嵌入在我们开发流程的每个阶段。从预训练数据筛选到部署后监控,我们坚持严格的标准,确保负责任的人工智能开发。我们的安全框架借鉴了对齐、可解释性和对抗鲁棒性方面的前沿研究。

红队测试

每次 Fathom 发布都经过内部安全团队和外部合作伙伴 500 小时以上的对抗性测试。我们的红队流程涵盖越狱尝试、提示注入、偏见利用和边缘案例推理失败。外部研究人员受邀参与我们的协调披露计划。

负责任的扩展政策

Wyrmlabs 采用基于 ASL(AI 安全级别)标准的分层负责任的扩展政策。目前运行在 ASL-2 级别,我们的 RSP 包括触发额外安全措施的能力阈值:ASL-2 自动红队测试,ASL-3 独立审计,以及更高级别的特定能力隔离协议。

偏见与公平性

我们跨人口统计维度、语言和使用场景评估 Fathom,以识别和缓解偏见。我们的公平性基准包括 BBQ、WinoBias 的翻译版本以及针对中文语境的自定义评估。我们随每次模型发布同时发布偏见审计结果。

开放安全报告

下载我们的完整安全评估报告,包括红队测试结果、偏见审计和 RSP 合规文档。

下载安全报告