文档 14 / 28

内容安全与审核规范

实时审核 · AI + 人工 · 分级处置 · 新加坡合规

册别:第三册 · 技术与架构 版本:V1.0 日期:2026-08-15 状态:草稿待评审

一、审核体系总览

核心理念:实时优先、AI 为主、人工兜底。目标是让违规内容在5 秒内被拦截,同时不误伤正常对话。

1.1 三级审核架构

[用户发言] → [L1 实时 AI 审核 <2s] → 通过 → [正常显示]
↓ 可疑
[L2 深度 AI 分析 <10s] → 通过 → [显示但标记] / 拦截 → [替换/阻断]
↓ 高优先级
[L3 人工审核 <5min] → 裁决 → [放行/警告/封禁]

1.2 审核指标

指标目标测量方式
L1 实时拦截延迟P95 < 2 秒每次审核计时
L2 深度分析延迟P95 < 10 秒异步队列监控
L3 人工响应P95 < 5 分钟工单系统计时
误杀率(False Positive)< 2%每日抽样 1000 条
漏放率(False Negative)< 0.5%每周红队测试
人工审核准确率> 98%双人复核 + 抽检

二、违规分类与严重度

2.1 违规类别

类别代码示例严重度
色情/NSFWnsfw露骨性内容/性暗示/性骚扰
仇恨言论hate种族/宗教/性别歧视言论
骚扰/欺凌harass持续纠缠/人身攻击/威胁中-高
诈骗/钓鱼scam投资骗局/虚假身份/诱导转账
未成年人underage疑似 <18 岁用户紧急
暴力/自残violence暴力描述/自残诱导
垃圾/骚扰广告spam重复刷屏/外部引流
政治敏感politics敏感政治话题/极端主义
隐私泄露privacy曝光他人手机号/地址
冒犯性语言profanity脏话/文化冒犯

2.2 严重度分级

低 L1
中 L2
高 L3
紧急 L4
等级定义响应时间处置
L1 低冒犯性语言/轻微不当AI 自动处理软替换/标记
L2 中骚扰/垃圾/隐私泄露< 2 分钟警告/限流/屏蔽
L3 高色情/仇恨/诈骗< 5 分钟即时封禁/报警
L4 紧急未成年人/暴力/生命威胁< 1 分钟立即断线/报警/冻结

三、L1 实时审核(<2 秒)

3.1 审核流程

[ASR 文本输出] → [L1 审核引擎] → 判断 → [放行/替换/拦截]

[同时异步发送到 L2 深度分析]

3.2 审核引擎

引擎用途延迟准确率
Google Perspective API毒性/攻击性评分~200ms~85%
自研分类模型(BERT-base)10 类违规分类~300ms~90%
关键词 + 正则快速过滤(第一道)~5ms~70%(高召回)
NER 实体识别手机号/身份证/地址检测~100ms~95%
用户信誉分基于历史行为的权重调整~10ms

3.3 决策逻辑

def l1_moderate(text, user_id, context): scores = {} # 1. 关键词快速过滤(高召回) keyword_hits = keyword_filter.scan(text) if keyword_hits: scores['keyword'] = max(h.severity for h in keyword_hits) # 2. Perspective API(毒性评分) toxicity = perspective_api.score(text, attributes=['TOXICITY','INSULT','THREAT']) scores['toxicity'] = toxicity['TOXICITY'] # 3. 自研分类模型 classification = bert_classifier.predict(text) scores['classifier'] = classification.max_prob # 4. 用户信誉加权 trust = get_user_trust_score(user_id) # 0-100 weight = 1.0 + (50 - trust) / 100 # 低信誉用户更严格 # 综合决策 max_score = max(scores.values()) * weight if max_score > 0.9: return "block", "high_confidence_violation" elif max_score > 0.7: return "replace", "mask_sensitive_content" elif max_score > 0.5: return "flag", "needs_review" else: return "allow", None

3.4 处置动作

动作效果用户感知
allow正常显示原文无感知
replace敏感词替换为 ***看到部分屏蔽的文本
flag正常显示 + 标记待审无感知(但被记录)
block拦截不显示看到"内容已被过滤"
escalate立即转 L3 人工通话可能中断

四、L2 深度分析(<10 秒)

4.1 分析维度

维度方法说明
上下文连贯对话窗口分析(前后 5 轮)单次看似正常,串联后暴露意图
语义改写检测同义词/谐音/拼音绕过"约炮"→"约 pào"→"yue pao"
行为模式用户历史违规频率首次 vs 惯犯区别对待
跨语言中英混合分析"fuck 你妈" 跨语言侮辱
情感分析情绪 escalat ion 检测从正常→愤怒→威胁的演变
时间密度单位时间违规次数刷屏/轰炸式骚扰

4.2 处置

判定动作后续
确认违规追溯替换已显示内容扣分 + 记录
疑似违规转 L3 人工审核5 分钟内裁决
误判恢复原文 + 模型反馈加入训练集
新违规模式规则提取 + 模型更新每周模型迭代

五、L3 人工审核

5.1 审核团队

项目规格
团队规模Phase 1:5 人(三班制覆盖 24×7)
语言要求中文(普通话+方言)+ 英语(流利)
培训周期2 周(法规 + 平台规则 + 实操)
工具内部审核后台(Web)
决策权L2 及以下:单人裁决 / L3+:双人复核
响应 SLAL2: 5min / L3: 2min / L4: 1min

5.2 审核后台功能

功能说明
实时队列按严重度排序的待审列表
对话上下文显示前后 10 轮完整对话
用户画像历史违规/信誉分/注册时长
一键处置放行/警告/限流/封禁/报警
快捷标签预设违规原因 + 自定义
质量抽检主管随机抽检 10%/天
审计日志所有操作不可篡改记录

5.3 处置阶梯

次数处置时长通知
第 1 次警告App 内通知
第 2 次限制匹配24 小时App 内通知
第 3 次限制匹配 + 禁言72 小时邮件 + App
第 4 次暂时封号7 天邮件 + SMS
第 5 次永久封号永久邮件 + 申诉通道
L4 紧急即时封号 + 报警永久警方 + 用户通知

六、举报系统

6.1 举报流程

[用户点击举报] → [选择原因 + 描述] → [即时动作(断线/屏蔽)]

[举报进入审核队列] → [L3 人工审核 <5min] → [处置 + 通知双方]

6.2 即时保护动作

举报原因即时动作后续
harass(骚扰)立即断开通话 + 双向屏蔽审核后决定是否解封
nsfw(色情)立即断开 + 屏蔽审核 + 可能永久封号
scam(诈骗)立即断开 + 屏蔽审核 + 可能报警
underage(未成年)立即断开 + 冻结双方紧急审核 + 上报
spam(垃圾)屏蔽该用户 1 小时累计触发升级
other(其他)不断线,仅记录审核后处置

6.3 举报反馈

时间给举报人给被举报人
即时"已收到举报,我们会处理"(无通知)
审核中"正在审核中"(无通知)
确认违规"已处理:对方已被警告/封禁""因违规被警告/封禁"
未违规"经审核未发现问题"(无通知)
申诉成功"经复核,原判定已撤销""封禁已解除"

七、新加坡法律合规

7.1 相关法律

法律关联内容Vocalink 应对
PDPA 2012个人数据保护审核数据加密 + 30 天自动删除
Broadcasting Act内容监管用户生成内容审核 + 投诉机制
Penal Code §292/293散布淫秽内容NSFW 严格审核 + 即时拦截
Penal Code §506刑事威胁威胁言论即时报警
Children & Young Persons Act保护未成年人年龄验证 + 疑似未成年即时冻结
Protection from Harassment Act反骚扰骚扰举报优先处理
Computer Misuse Act网络诈骗诈骗举报 + 配合警方

7.2 数据保留与删除

数据类型保留期删除方式
违规对话文本90 天自动加密删除
审核日志3 年归档后删除
举报记录3 年归档后删除
封号记录永久(脱敏)
申诉记录2 年自动删除

7.3 警方协作

场景触发条件动作
未成年人保护确认/疑似 <18 岁冻结 + 通知警方 + 通知家长
生命威胁自杀/他杀威胁冻结 + 紧急报警(999)
诈骗团伙≥3 人举报同一用户封号 + 移交警方
法院命令收到合法传票配合提供数据
国家安全ISD 请求配合(不通知用户)

八、审核运营指标

8.1 日报指标

指标Phase 1 目标监控方式
日均审核量~500 条审核后台仪表盘
AI 自动处理率> 85%每日统计
人工审核量< 15%工单系统
误杀率< 2%用户申诉率
漏放率< 0.5%红队测试
平均响应时间< 3 分钟SLA 监控
用户申诉成功率10-20%申诉系统
封号率< 0.5%每日统计

8.2 周报/月报

报告内容受众
每周审核摘要趋势/热点/新违规模式产品+运营+CEO
每月合规报告详细统计/法律事件/改进董事会+法务
季度模型评估误杀/漏放/模型迭代效果算法团队
年度安全报告全面数据/趋势/展望公开(透明报告)

九、申诉机制

9.1 申诉流程

[用户收到封禁通知] → [点击"申诉"] → [填写申诉理由 + 证据]

[申诉进入优先队列] → [高级审核员复审 <24h] → [维持/撤销/减轻]

[通知结果] → [如维持:可二次申诉 → 最终裁决]

9.2 申诉规则

规则说明
申诉时限封号后 30 天内
首次申诉24 小时内回复
二次申诉48 小时内回复(最终)
证据要求截图/对话记录/第三方证明
语言中文/英语
透明度告知判定依据(脱敏)
极端情况可申请人工电话沟通

十、审核模型迭代

10.1 迭代周期

周期动作负责人
每日收集误判样本 + 规则微调审核运营
每周模型再训练(增量数据)算法团队
每两周A/B 测试新模型 vs 旧模型算法+产品
每月全面评估 + 上线决策全员评审
每季度架构升级评估架构团队

10.2 训练数据管理

数据类型来源处理保留
误判样本用户申诉 + 抽检人工标注 + 脱敏永久(训练集)
违规样本审核确认脱敏 + 分类标注3 年
正常样本随机抽样脱敏1 年
对抗样本红队测试标注绕过方式永久

✅ 模型效果追踪:

指标Phase 1 目标Phase 2 目标
精确率 (Precision)> 90%> 95%
召回率 (Recall)> 85%> 92%
F1 Score> 0.87> 0.93
误杀率< 2%< 1%
漏放率< 0.5%< 0.2%

附录

附录 A:审核 SOP 快速参考

场景即时动作后续
用户说"我想杀你"即时断线 + 冻结报警 + 通知对方
用户索要 WhatsApp替换联系方式 + 标记累计 3 次封号
用户发送色情图片即时断线 + 封号永久封禁 + 报警
疑似未成年人冻结双方 + 验证验证失败→封号+报警
用户说"投资返利"即时断线 + 标记移交反诈中心
正常对话误杀恢复 + 道歉补偿加入训练集

附录 B:相关文档

文档关联内容
08 系统架构 HLDSafety Service 在架构中的位置
10 API 接口规范/safety/* 接口契约
11 数据库设计reports 表 + 审核日志
09 翻译子系统 LLD翻译文本→审核→显示链路

附录 C:修订记录

版本日期修改内容作者
V1.02026-08-15初始版本安全团队