Anthropic Anthropic

AI 安全实验室(Claude);可解释性与对齐 · AI safety lab (Claude); interpretability & alignment

Claude 背后的 AI 安全公司;RLHF、宪法式 AI、红队测试与机制可解释性的先驱。

AI safety company behind Claude; pioneering RLHF, Constitutional AI, red-teaming and mechanistic interpretability.

在 AI Paper 查看 TA 的全部论文 →

收录的 22 篇论文(按被引排序)