实时审核 · AI + 人工 · 分级处置 · 新加坡合规
核心理念:实时优先、AI 为主、人工兜底。目标是让违规内容在5 秒内被拦截,同时不误伤正常对话。
| 指标 | 目标 | 测量方式 |
|---|---|---|
| L1 实时拦截延迟 | P95 < 2 秒 | 每次审核计时 |
| L2 深度分析延迟 | P95 < 10 秒 | 异步队列监控 |
| L3 人工响应 | P95 < 5 分钟 | 工单系统计时 |
| 误杀率(False Positive) | < 2% | 每日抽样 1000 条 |
| 漏放率(False Negative) | < 0.5% | 每周红队测试 |
| 人工审核准确率 | > 98% | 双人复核 + 抽检 |
| 类别 | 代码 | 示例 | 严重度 |
|---|---|---|---|
| 色情/NSFW | nsfw | 露骨性内容/性暗示/性骚扰 | 高 |
| 仇恨言论 | hate | 种族/宗教/性别歧视言论 | 高 |
| 骚扰/欺凌 | harass | 持续纠缠/人身攻击/威胁 | 中-高 |
| 诈骗/钓鱼 | scam | 投资骗局/虚假身份/诱导转账 | 高 |
| 未成年人 | underage | 疑似 <18 岁用户 | 紧急 |
| 暴力/自残 | violence | 暴力描述/自残诱导 | 高 |
| 垃圾/骚扰广告 | spam | 重复刷屏/外部引流 | 中 |
| 政治敏感 | politics | 敏感政治话题/极端主义 | 中 |
| 隐私泄露 | privacy | 曝光他人手机号/地址 | 中 |
| 冒犯性语言 | profanity | 脏话/文化冒犯 | 低 |
| 等级 | 定义 | 响应时间 | 处置 |
|---|---|---|---|
| L1 低 | 冒犯性语言/轻微不当 | AI 自动处理 | 软替换/标记 |
| L2 中 | 骚扰/垃圾/隐私泄露 | < 2 分钟 | 警告/限流/屏蔽 |
| L3 高 | 色情/仇恨/诈骗 | < 5 分钟 | 即时封禁/报警 |
| L4 紧急 | 未成年人/暴力/生命威胁 | < 1 分钟 | 立即断线/报警/冻结 |
| 引擎 | 用途 | 延迟 | 准确率 |
|---|---|---|---|
| Google Perspective API | 毒性/攻击性评分 | ~200ms | ~85% |
| 自研分类模型(BERT-base) | 10 类违规分类 | ~300ms | ~90% |
| 关键词 + 正则 | 快速过滤(第一道) | ~5ms | ~70%(高召回) |
| NER 实体识别 | 手机号/身份证/地址检测 | ~100ms | ~95% |
| 用户信誉分 | 基于历史行为的权重调整 | ~10ms | — |
| 动作 | 效果 | 用户感知 |
|---|---|---|
| allow | 正常显示原文 | 无感知 |
| replace | 敏感词替换为 *** | 看到部分屏蔽的文本 |
| flag | 正常显示 + 标记待审 | 无感知(但被记录) |
| block | 拦截不显示 | 看到"内容已被过滤" |
| escalate | 立即转 L3 人工 | 通话可能中断 |
| 维度 | 方法 | 说明 |
|---|---|---|
| 上下文连贯 | 对话窗口分析(前后 5 轮) | 单次看似正常,串联后暴露意图 |
| 语义改写检测 | 同义词/谐音/拼音绕过 | "约炮"→"约 pào"→"yue pao" |
| 行为模式 | 用户历史违规频率 | 首次 vs 惯犯区别对待 |
| 跨语言 | 中英混合分析 | "fuck 你妈" 跨语言侮辱 |
| 情感分析 | 情绪 escalat ion 检测 | 从正常→愤怒→威胁的演变 |
| 时间密度 | 单位时间违规次数 | 刷屏/轰炸式骚扰 |
| 判定 | 动作 | 后续 |
|---|---|---|
| 确认违规 | 追溯替换已显示内容 | 扣分 + 记录 |
| 疑似违规 | 转 L3 人工审核 | 5 分钟内裁决 |
| 误判 | 恢复原文 + 模型反馈 | 加入训练集 |
| 新违规模式 | 规则提取 + 模型更新 | 每周模型迭代 |
| 项目 | 规格 |
|---|---|
| 团队规模 | Phase 1:5 人(三班制覆盖 24×7) |
| 语言要求 | 中文(普通话+方言)+ 英语(流利) |
| 培训周期 | 2 周(法规 + 平台规则 + 实操) |
| 工具 | 内部审核后台(Web) |
| 决策权 | L2 及以下:单人裁决 / L3+:双人复核 |
| 响应 SLA | L2: 5min / L3: 2min / L4: 1min |
| 功能 | 说明 |
|---|---|
| 实时队列 | 按严重度排序的待审列表 |
| 对话上下文 | 显示前后 10 轮完整对话 |
| 用户画像 | 历史违规/信誉分/注册时长 |
| 一键处置 | 放行/警告/限流/封禁/报警 |
| 快捷标签 | 预设违规原因 + 自定义 |
| 质量抽检 | 主管随机抽检 10%/天 |
| 审计日志 | 所有操作不可篡改记录 |
| 次数 | 处置 | 时长 | 通知 |
|---|---|---|---|
| 第 1 次 | 警告 | — | App 内通知 |
| 第 2 次 | 限制匹配 | 24 小时 | App 内通知 |
| 第 3 次 | 限制匹配 + 禁言 | 72 小时 | 邮件 + App |
| 第 4 次 | 暂时封号 | 7 天 | 邮件 + SMS |
| 第 5 次 | 永久封号 | 永久 | 邮件 + 申诉通道 |
| L4 紧急 | 即时封号 + 报警 | 永久 | 警方 + 用户通知 |
| 举报原因 | 即时动作 | 后续 |
|---|---|---|
| harass(骚扰) | 立即断开通话 + 双向屏蔽 | 审核后决定是否解封 |
| nsfw(色情) | 立即断开 + 屏蔽 | 审核 + 可能永久封号 |
| scam(诈骗) | 立即断开 + 屏蔽 | 审核 + 可能报警 |
| underage(未成年) | 立即断开 + 冻结双方 | 紧急审核 + 上报 |
| spam(垃圾) | 屏蔽该用户 1 小时 | 累计触发升级 |
| other(其他) | 不断线,仅记录 | 审核后处置 |
| 时间 | 给举报人 | 给被举报人 |
|---|---|---|
| 即时 | "已收到举报,我们会处理" | (无通知) |
| 审核中 | "正在审核中" | (无通知) |
| 确认违规 | "已处理:对方已被警告/封禁" | "因违规被警告/封禁" |
| 未违规 | "经审核未发现问题" | (无通知) |
| 申诉成功 | "经复核,原判定已撤销" | "封禁已解除" |
| 法律 | 关联内容 | Vocalink 应对 |
|---|---|---|
| PDPA 2012 | 个人数据保护 | 审核数据加密 + 30 天自动删除 |
| Broadcasting Act | 内容监管 | 用户生成内容审核 + 投诉机制 |
| Penal Code §292/293 | 散布淫秽内容 | NSFW 严格审核 + 即时拦截 |
| Penal Code §506 | 刑事威胁 | 威胁言论即时报警 |
| Children & Young Persons Act | 保护未成年人 | 年龄验证 + 疑似未成年即时冻结 |
| Protection from Harassment Act | 反骚扰 | 骚扰举报优先处理 |
| Computer Misuse Act | 网络诈骗 | 诈骗举报 + 配合警方 |
| 数据类型 | 保留期 | 删除方式 |
|---|---|---|
| 违规对话文本 | 90 天 | 自动加密删除 |
| 审核日志 | 3 年 | 归档后删除 |
| 举报记录 | 3 年 | 归档后删除 |
| 封号记录 | 永久(脱敏) | — |
| 申诉记录 | 2 年 | 自动删除 |
| 场景 | 触发条件 | 动作 |
|---|---|---|
| 未成年人保护 | 确认/疑似 <18 岁 | 冻结 + 通知警方 + 通知家长 |
| 生命威胁 | 自杀/他杀威胁 | 冻结 + 紧急报警(999) |
| 诈骗团伙 | ≥3 人举报同一用户 | 封号 + 移交警方 |
| 法院命令 | 收到合法传票 | 配合提供数据 |
| 国家安全 | ISD 请求 | 配合(不通知用户) |
| 指标 | Phase 1 目标 | 监控方式 |
|---|---|---|
| 日均审核量 | ~500 条 | 审核后台仪表盘 |
| AI 自动处理率 | > 85% | 每日统计 |
| 人工审核量 | < 15% | 工单系统 |
| 误杀率 | < 2% | 用户申诉率 |
| 漏放率 | < 0.5% | 红队测试 |
| 平均响应时间 | < 3 分钟 | SLA 监控 |
| 用户申诉成功率 | 10-20% | 申诉系统 |
| 封号率 | < 0.5% | 每日统计 |
| 报告 | 内容 | 受众 |
|---|---|---|
| 每周审核摘要 | 趋势/热点/新违规模式 | 产品+运营+CEO |
| 每月合规报告 | 详细统计/法律事件/改进 | 董事会+法务 |
| 季度模型评估 | 误杀/漏放/模型迭代效果 | 算法团队 |
| 年度安全报告 | 全面数据/趋势/展望 | 公开(透明报告) |
| 规则 | 说明 |
|---|---|
| 申诉时限 | 封号后 30 天内 |
| 首次申诉 | 24 小时内回复 |
| 二次申诉 | 48 小时内回复(最终) |
| 证据要求 | 截图/对话记录/第三方证明 |
| 语言 | 中文/英语 |
| 透明度 | 告知判定依据(脱敏) |
| 极端情况 | 可申请人工电话沟通 |
| 周期 | 动作 | 负责人 |
|---|---|---|
| 每日 | 收集误判样本 + 规则微调 | 审核运营 |
| 每周 | 模型再训练(增量数据) | 算法团队 |
| 每两周 | A/B 测试新模型 vs 旧模型 | 算法+产品 |
| 每月 | 全面评估 + 上线决策 | 全员评审 |
| 每季度 | 架构升级评估 | 架构团队 |
| 数据类型 | 来源 | 处理 | 保留 |
|---|---|---|---|
| 误判样本 | 用户申诉 + 抽检 | 人工标注 + 脱敏 | 永久(训练集) |
| 违规样本 | 审核确认 | 脱敏 + 分类标注 | 3 年 |
| 正常样本 | 随机抽样 | 脱敏 | 1 年 |
| 对抗样本 | 红队测试 | 标注绕过方式 | 永久 |
✅ 模型效果追踪:
| 指标 | Phase 1 目标 | Phase 2 目标 |
|---|---|---|
| 精确率 (Precision) | > 90% | > 95% |
| 召回率 (Recall) | > 85% | > 92% |
| F1 Score | > 0.87 | > 0.93 |
| 误杀率 | < 2% | < 1% |
| 漏放率 | < 0.5% | < 0.2% |
| 场景 | 即时动作 | 后续 |
|---|---|---|
| 用户说"我想杀你" | 即时断线 + 冻结 | 报警 + 通知对方 |
| 用户索要 WhatsApp | 替换联系方式 + 标记 | 累计 3 次封号 |
| 用户发送色情图片 | 即时断线 + 封号 | 永久封禁 + 报警 |
| 疑似未成年人 | 冻结双方 + 验证 | 验证失败→封号+报警 |
| 用户说"投资返利" | 即时断线 + 标记 | 移交反诈中心 |
| 正常对话误杀 | 恢复 + 道歉补偿 | 加入训练集 |
| 文档 | 关联内容 |
|---|---|
| 08 系统架构 HLD | Safety Service 在架构中的位置 |
| 10 API 接口规范 | /safety/* 接口契约 |
| 11 数据库设计 | reports 表 + 审核日志 |
| 09 翻译子系统 LLD | 翻译文本→审核→显示链路 |
| 版本 | 日期 | 修改内容 | 作者 |
|---|---|---|---|
| V1.0 | 2026-08-15 | 初始版本 | 安全团队 |