AI 安全实验室(Claude);可解释性与对齐 · AI safety lab (Claude); interpretability & alignment
Claude 背后的 AI 安全公司;RLHF、宪法式 AI、红队测试与机制可解释性的先驱。
AI safety company behind Claude; pioneering RLHF, Constitutional AI, red-teaming and mechanistic interpretability.
在 AI Paper 查看 TA 的全部论文 →