← 返回列表 今日速报 2026年9月12日 02:42 来源:Hugging Face Blog 安全为谁服务?拒绝特定子主题,而非整个主题 探讨 AI 安全对齐中的精细化拒绝机制:模型应在有害话题中识别并拒绝真正危险的子主题,而非对整个话题一刀切式回避,以提升安全性的同时保留有用信息。该文来自 Hugging Face 博客。 阅读原文 纠错 探讨 AI 安全对齐中的精细化拒绝机制:模型应在有害话题中识别并拒绝真正危险的子主题,而非对整个话题一刀切式回避,以提升安全性的同时保留有用信息。该文来自 Hugging Face 博客。阅读原文