Skip to content

本模块聚焦数据安全与隐私保护,涵盖加密技术、数据脱敏、隐私计算、合规要求、DLP、密钥管理、安全审计等核心主题。是数据安全工程师和合规岗位的重点考察内容。


Q1: 什么是数据加密?对称加密和非对称加密的区别? 「🟡 中级」

考察点:考察密码学基础知识。筛掉对加密原理不了解、混淆对称和非对称加密的开发和安全人员。

参考答案

数据加密是指通过加密算法和密钥,将明文(原始数据)转换为密文(不可读数据)的过程,只有持有正确密钥的接收方才能解密还原出明文。目的是保护数据的机密性。

对称加密(Symmetric Encryption)

  • 特点:加密和解密使用同一个密钥
  • 常用算法
    • AES(Advanced Encryption Standard):目前最主流,密钥长度 128/192/256 位
    • DES / 3DES:已过时,安全性不足
    • SM4:国密算法,中国商用密码标准
  • 优点:计算速度快,适合大量数据加密
  • 缺点:密钥分发困难,密钥管理复杂
  • 应用场景:大数据加密、文件加密、数据库加密、通信会话加密

非对称加密(Asymmetric Encryption)

  • 特点:使用一对密钥——公钥(Public Key)和私钥(Private Key)
    • 公钥加密,私钥解密
    • 私钥签名,公钥验签
  • 常用算法
    • RSA:最经典,基于大整数分解难题,密钥长度 2048/4096 位
    • ECC(椭圆曲线加密):相同安全强度下密钥更短,计算更快
    • SM2:国密非对称算法
  • 优点:解决了密钥分发问题,可用于数字签名
  • 缺点:计算速度慢,不适合大量数据加密
  • 应用场景:密钥交换、数字签名、证书、HTTPS 握手

核心区别对比

特性对称加密非对称加密
密钥数量1个(共享密钥)2个(公钥+私钥)
速度快(100~1000倍)
密钥分发困难容易(公钥公开)
主要用途加密大量数据密钥交换、数字签名
安全性依赖密钥保密依赖数学难题

混合加密(Hybrid Encryption)

实际应用中通常结合两者的优点:

1. 生成随机对称密钥(会话密钥)
2. 用对称密钥加密大量数据
3. 用接收方的公钥加密对称密钥
4. 将加密后的数据 + 加密后的密钥一起发送
5. 接收方用私钥解密得到对称密钥
6. 用对称密钥解密数据

HTTPS、PGP 等都是混合加密的典型应用。

追问延伸

  • HTTPS 中对称加密和非对称加密分别用在哪里?
  • AES 的 ECB、CBC、GCM 模式有什么区别?哪个更安全?
  • RSA 为什么慢?慢到什么程度?
  • 什么是数字签名?非对称加密如何实现签名?
  • 国密算法有哪些?SM2/SM3/SM4 分别是什么?

Q2: 什么是数据脱敏?常见方法有哪些? 「🟡 中级」

考察点:考察数据隐私保护的实践方法。筛掉对数据安全治理不了解、随意使用生产数据的开发和测试人员。

参考答案

数据脱敏(Data Masking / Data Anonymization)是指对敏感数据进行变形、替换或隐藏,使其无法识别出真实的个人或敏感信息,同时保留数据的格式和业务特征,以便在非生产环境中安全使用。

应用场景

  • 开发测试环境:将生产数据脱敏后提供给开发测试使用
  • 数据分析:对外提供数据用于分析,保护用户隐私
  • 数据共享:跨部门、跨企业数据共享
  • 界面展示:前端页面展示时对敏感信息打码

常见脱敏方法

  1. 替换(Substitution)

    • 用伪造但格式一致的数据替换真实数据
    • 如将真实姓名替换为随机生成的假姓名
    • 优点:保留数据格式和分布特征
    • 工具:Faker 库
  2. 掩码(Masking)

    • 只保留部分信息,其余用特殊字符(*)遮盖
    • 如手机号:138****1234
    • 如身份证:110***********1234
    • 如银行卡号:6222 **** **** 1234
    • 常用于展示场景
  3. 泛化(Generalization)

    • 将精确值替换为范围值,降低精度
    • 如年龄 28 → 25-30 岁
    • 如具体地址 → 所在城市
    • 如精确日期 → 年份或月份
    • 常用于数据分析场景
  4. 随机化(Randomization)

    • 随机打乱数据,破坏真实对应关系
    • 如将姓名列随机打乱,仍有姓名字段但和其他字段不对应
    • 洗牌算法实现
  5. 加密(Encryption)

    • 使用加密算法加密敏感字段
    • 保留解密能力(授权用户可解密查看)
    • 适用于需要保留原始数据但限制访问的场景
    • 格式保留加密(FPE):加密后保持原格式
  6. 删除/置空

    • 直接删除不需要的敏感字段
    • 最彻底,但数据可用性最低
  7. 哈希(Hashing)

    • 对数据进行哈希处理
    • 注意:单纯哈希不安全,可通过彩虹表反查,需要加盐
    • 适用于不需要还原但需要比对的场景

脱敏原则

  • 最小可用:只保留必要的信息
  • 不可逆:脱敏后的数据不能被还原(根据场景需求)
  • 一致性:同一数据脱敏后结果一致(保证关联关系)
  • 格式保持:脱敏后数据格式不变,不影响系统使用

追问延伸

  • 数据脱敏和数据加密有什么区别?
  • 什么是 k-匿名、l-多样性、t-接近性?(隐私保护评估标准)
  • 开发测试环境的数据脱敏通常怎么做?有什么工具?
  • 什么是差分隐私?和传统脱敏有什么区别?
  • 如何保证脱敏数据的业务可用性?(如保持数据分布、关联关系)

Q3: 什么是隐私计算?有哪些技术? 「🔴 高级」

考察点:考察前沿隐私保护技术的了解。筛掉对数据安全前沿领域不关注的高级安全和算法人员。

参考答案

隐私计算(Privacy Computing / Privacy-Preserving Computation)是一类技术的统称,目标是在不泄露原始数据的前提下,对数据进行计算和分析,实现"数据可用不可见"。

核心价值

  • 解决数据流通和隐私保护之间的矛盾
  • 让多方可以联合计算数据,但各方都不暴露自己的原始数据
  • 满足数据合规要求(GDPR、个人信息保护法等)

主要技术方向

1. 联邦学习(Federated Learning)

  • 定义:多个参与方在不交换原始数据的前提下,协同训练机器学习模型
  • 原理
    • 各方在本地用自己的数据训练模型
    • 只上传模型参数或梯度到协调方
    • 协调方聚合各方参数,更新全局模型
    • 多轮迭代后得到最终模型
  • 分类
    • 横向联邦:样本不同,特征相同(如两家银行联合建模)
    • 纵向联邦:样本相同,特征不同(如银行和电商联合建模)
    • 联邦迁移学习:样本和特征都不同
  • 应用场景:金融风控、医疗AI、广告推荐

2. 安全多方计算(MPC / Secure Multi-Party Computation)

  • 定义:多个参与方共同计算一个函数,各方只输入自己的私有数据,计算过程中不泄露任何中间信息,最终只得到计算结果
  • 核心技术
    • 混淆电路(Garbled Circuits)
    • 秘密共享(Secret Sharing)
    • 同态加密(部分应用)
    • 不经意传输(Oblivious Transfer)
  • 特点
    • 安全性最高,可证明安全
    • 计算开销大,通信开销大
    • 适合小数据量的精确计算
  • 应用场景:联合统计、数据查询、竞拍、隐私求交

3. 同态加密(Homomorphic Encryption)

  • 定义:一种特殊的加密算法,可以直接对密文进行计算,解密后得到的结果和对明文计算的结果相同
  • 公式描述Decrypt(Encrypt(a) + Encrypt(b)) = a + b
  • 分类
    • 部分同态:只支持加法或乘法一种运算
    • 全同态(FHE):支持任意运算
  • 特点
    • 可以实现任意函数的隐私计算
    • 全同态加密计算开销极大,目前还难以大规模实用
  • 应用场景:云外包计算、加密数据检索

4. 差分隐私(Differential Privacy)

  • 定义:通过在数据或计算结果中添加精心设计的噪声,使得攻击者无法通过查询结果判断某个人是否在数据集中
  • 核心概念
    • ε(epsilon):隐私预算,值越小隐私保护越强,但数据可用性越低
    • 敏感度:函数在相邻数据集上的最大输出差异
  • 实现方式
    • 中心化差分隐私:数据集中后加噪声
    • 本地化差分隐私:每个用户本地加噪声后再上传
  • 应用场景:统计查询、数据发布、推荐系统
  • 实际案例:苹果 iOS 的差分隐私、Google Chrome 的隐私统计

技术对比

技术隐私强度计算效率数据精度适用场景
联邦学习中高机器学习建模
MPC联合统计、精确计算
同态加密极低云加密计算
差分隐私可调低(有噪声)统计发布、数据采集

追问延伸

  • 联邦学习有什么安全风险?(梯度泄露、成员推断、模型投毒)
  • 什么是隐私集合求交(PSI)?属于哪种隐私计算技术?
  • 差分隐私的 ε 是什么意思?如何选择 ε 的值?
  • 同态加密为什么慢?全同态加密的发展现状如何?
  • 隐私计算和数据脱敏有什么区别?

Q4: GDPR/个人信息保护法有哪些核心要求? 「🟡 中级」

考察点:考察数据合规意识。筛掉对隐私法规不了解、数据处理随意的开发和产品人员。

参考答案

GDPR(General Data Protection Regulation,通用数据保护条例)是欧盟的隐私保护法规,2018 年生效,是全球最严格的隐私法规之一。

《个人信息保护法》(PIPL)是中国的个人信息保护法律,2021 年 11 月 1 日起施行,借鉴了 GDPR 的很多理念。

核心原则和要求

1. 数据最小化(Data Minimization)

  • 只收集实现目的所必需的最少数据
  • 不能过度收集、"全家桶式"收集
  • 例如:地图 App 不需要读取通讯录

2. 目的限定(Purpose Limitation)

  • 收集数据时要有明确、合法、正当的目的
  • 后续使用不能超出最初声明的目的
  • 超出原目的需要再次获得同意

3. 知情同意(Consent)

  • 处理个人信息前需获得个人的同意
  • 同意必须是自愿、明确、具体的
  • 个人有权随时撤回同意,且撤回应和给予同意一样容易
  • 不得用"不同意就不能用"的方式强迫同意(基础功能除外)

4. 数据主体权利

  • 知情权:知道个人信息如何被处理
  • 访问权:可以查询自己的个人信息
  • 更正权:要求更正不准确的信息
  • 删除权(被遗忘权):要求删除个人信息
  • 可携带权:获取个人信息副本并转移
  • 反对权:反对基于合法利益的处理
  • 解释权:对自动化决策结果有解释权

5. 数据泄露通知(Data Breach Notification)

  • 发生个人信息泄露后,需在规定时间内向监管机构报告
  • GDPR:72 小时内
  • 个保法:立即采取补救措施,并通知监管部门和个人
  • 可能对个人造成高风险时,需通知受影响的个人

6. 问责制(Accountability)

  • 数据控制者/处理者需对个人信息处理活动负责
  • 需建立内部管理制度、采取安全措施
  • 需记录处理活动,接受监管检查

7. 其他重要要求

  • 合法性基础:处理个人信息必须有合法基础(同意、合同履行、法定义务、公共利益、合法利益等)
  • 跨境传输:个人信息跨境传输需满足特定条件(安全评估、认证、标准合同等)
  • DPO(数据保护官):特定规模的企业需要设立
  • 隐私影响评估(PIA/DPIA):高风险处理活动需事前评估
  • 重罚机制:GDPR 最高罚款 2000 万欧元或全球年营业额的 4%(取较高者)

追问延伸

  • 个人信息和敏感个人信息有什么区别?敏感信息包括哪些?
  • 什么是数据控制者和数据处理者?有什么区别和责任?
  • 个人信息跨境传输有哪些合法路径?
  • 什么是隐私设计(Privacy by Design)?
  • 产品开发中如何落实隐私合规要求?

Q5: 什么是数据泄露防护(DLP)? 「🔴 高级」

考察点:考察数据安全治理的体系化能力。筛掉对企业数据安全防护方案不了解的安全架构和管理人员。

参考答案

DLP(Data Loss Prevention,数据泄露防护)是一套技术和管理体系,用于识别、监控和保护企业的敏感数据,防止敏感数据通过各种渠道被未授权地泄露或带出企业。

核心目标

  • 发现敏感数据在哪里
  • 监控敏感数据的流动
  • 阻止敏感数据的违规外泄

DLP 的技术手段

1. 内容识别技术

  • 关键字/正则匹配:根据关键词或正则表达式识别敏感内容(如身份证号、银行卡号)
  • 指纹匹配:对敏感文档生成指纹,精确匹配
  • 文件类型识别:识别文件格式(源代码、设计文档等)
  • 机器学习分类:训练模型自动识别敏感文档
  • 数据标签:通过数据分类分级打标签,DLP 识别标签

2. 策略控制

  • 监控(Monitor):只记录不阻断,用于摸底和调优
  • 警告(Warn):用户操作时弹出警告,用户确认后可继续
  • 阻断(Block):直接阻止违规操作
  • 加密(Encrypt):自动加密敏感文件
  • 隔离(Quarantine):将违规文件移到隔离区

DLP 部署方式

1. 网络 DLP(Network DLP)

  • 部署在网络出口,监控所有出站流量
  • 监控协议:HTTP/HTTPS、FTP、SMTP 邮件、即时通讯等
  • 检测外发内容中的敏感数据,违规则阻断或告警

2. 终端 DLP(Endpoint DLP)

  • 在员工电脑上安装客户端代理
  • 监控本地操作:U盘拷贝、打印、截屏、复制粘贴、刻录光盘等
  • 可以做更细粒度的控制
  • 优点:控制能力强;缺点:需要部署客户端

3. 存储 DLP(Storage DLP)

  • 扫描文件服务器、数据库、云存储等存储位置
  • 发现敏感数据的存储位置和分布
  • 识别权限配置不当、冗余敏感数据等问题
  • 用于数据发现和分类分级

4. 云 DLP(Cloud DLP)

  • 针对 SaaS 应用(邮件、网盘、协作平台等)
  • 集成到云服务中,监控云环境中的数据流动

DLP 实施步骤

  1. 数据发现:搞清楚敏感数据在哪里
  2. 分类分级:对数据进行分类和分级,定义敏感级别
  3. 策略制定:针对不同级别数据制定不同的防护策略
  4. 监控调优:先监控模式运行,降低误报率
  5. 阻断执行:策略成熟后切换到阻断模式
  6. 持续优化:根据业务变化不断调整

追问延伸

  • DLP 和数据防泄漏、数据泄露防护是一回事吗?
  • DLP 的误报率高吗?如何降低误报?
  • 什么是数据分类分级?和 DLP 有什么关系?
  • 终端 DLP 会不会影响员工正常工作?如何平衡安全和效率?
  • DLP 能防止内部人员主动泄密吗?有什么局限性?

Q6: 密钥管理有哪些最佳实践? 「🔴 高级」

考察点:考察密钥安全的体系化知识。筛掉对密钥生命周期管理不了解、密钥随意存放的安全和运维人员。

参考答案

密钥管理(Key Management)是指对密钥的生成、存储、分发、使用、轮换、归档和销毁等全生命周期进行安全管理的过程。密钥是加密体系的核心,密钥泄露意味着加密数据的完全暴露。

密钥生命周期

生成 → 分发 → 存储 → 使用 → 轮换 → 归档 → 销毁

最佳实践

1. 密钥生成

  • 使用密码学安全的随机数生成器(CSPRNG)
  • 密钥长度满足安全要求(AES-256、RSA-2048+、ECC-256+)
  • 密钥生成环境安全(离线生成、专用硬件)
  • 不同用途使用不同密钥,不要一把密钥走天下

2. 密钥分级

密钥分层管理,上层密钥保护下层密钥:

层级密钥类型说明
L0根密钥(Root Key)最高级别,离线存储,保护主密钥
L1主密钥(Master Key)保护数据加密密钥
L2数据加密密钥(DEK)直接加密业务数据
  • 根密钥使用最少,安全性最高
  • 数据加密密钥可以频繁更换,由上层密钥保护

3. 密钥存储

  • 禁止硬编码:密钥不能写在代码、配置文件中
  • 使用 KMS(密钥管理服务):专业的密钥管理系统
    • 云厂商 KMS:AWS KMS、阿里云 KMS、腾讯云 KMS
    • 自建 KMS:HashiCorp Vault
  • HSM(硬件安全模块):高安全场景使用专用硬件存储密钥
    • 密钥无法被导出,加密运算在硬件内部完成
    • 金融、政务等高安全等级场景
  • 数据库中只存密文密钥或密钥 ID,不存明文密钥

4. 密钥分发

  • 密钥传输过程中必须加密保护
  • 非对称加密协商对称密钥(如 TLS 握手)
  • 密钥拆分共享(Shamir 秘密共享):多人各持一部分,需多人配合才能恢复

5. 密钥轮换(Key Rotation)

  • 定期更换密钥,降低密钥泄露的影响
  • 自动轮换:KMS 支持自动轮换功能
  • 数据密钥轮换:新数据用新密钥加密,旧数据用旧密钥解密后用新密钥重加密
  • 密钥泄露时立即应急轮换

6. 密钥销毁

  • 不再使用的密钥要彻底销毁
  • 销毁方式:安全删除、粉碎硬件、多次覆写
  • 归档密钥按保留期限到期后销毁
  • 销毁操作需审计记录

7. 访问控制

  • 最小权限原则:谁需要用才给谁访问权限
  • 密钥使用操作需审计日志
  • 关键操作多人审批(M of N)

8. 备份与恢复

  • 密钥必须有备份,防止丢失导致数据不可用
  • 备份密钥存储在安全的离线位置
  • 定期演练密钥恢复流程

追问延伸

  • 什么是信封加密(Envelope Encryption)?和密钥分级有什么关系?
  • KMS 和 HSM 有什么区别?
  • 代码里的密钥和配置怎么管理?用什么工具?
  • 密钥轮换时,已加密的数据怎么办?
  • 什么是密钥泄露检测?如何发现密钥已经泄露?

Q7: 什么是安全审计日志?应该记录什么? 「🟡 中级」

考察点:考察安全可审计性的理解。筛掉对日志安全和溯源取证不重视的开发和运维人员。

参考答案

安全审计日志是记录系统中与安全相关事件的日志,用于事后追溯、安全分析、合规审计和入侵检测。它是安全事件响应和取证的基础。

核心原则:记录"谁(Who)在什么时候(When)从哪里(Where)做了什么(What)结果如何(Result)"——即 5W 原则。

应该记录的内容

1. 身份认证相关

  • 登录成功/失败(用户名、IP、时间、设备信息)
  • 登出记录
  • 密码修改、密码重置
  • 多因素认证操作
  • 账号锁定、解锁

2. 权限变更相关

  • 用户创建/删除/禁用
  • 角色/权限变更
  • 管理员操作(提权、改配置等)

3. 数据操作相关

  • 敏感数据的增删改查
  • 数据导出、下载
  • 数据批量操作
  • 数据跨系统传输

4. 系统配置相关

  • 安全配置修改(防火墙规则、访问控制策略)
  • 系统参数修改
  • 软件安装/卸载/升级

5. 安全事件相关

  • 攻击检测告警(WAF、IDS 告警)
  • 恶意代码检测
  • 异常行为检测(异常登录、异常访问)
  • 安全扫描记录

每条日志应包含的字段

  • 时间戳:精确到毫秒,使用 UTC 或明确时区
  • 事件类型:登录、权限变更、数据操作等
  • 主体:用户 ID、账号名、服务名
  • 源 IP / 位置:请求来源
  • 目标资源:操作的对象(URL、文件、数据表等)
  • 操作动作:GET/POST/DELETE、增删改查等
  • 操作结果:成功/失败、失败原因
  • 请求参数:关键参数(注意脱敏)
  • 设备/用户代理:User-Agent、设备指纹

日志安全保护

  1. 防篡改

    • 日志集中存储,不在本地留存
    • 日志服务器独立,权限严格控制
    • 使用只追加(append-only)存储
    • 日志签名(每条日志加哈希或数字签名)
  2. 访问控制

    • 日志查询需要权限审批
    • 禁止删除和修改日志
    • 操作日志本身也要被记录
  3. 存储安全

    • 加密存储敏感日志
    • 定期备份
    • 设置合理的保留期限(合规要求通常 6 个月以上)
  4. 日志分析

    • 集中收集和分析(ELK、Splunk、SIEM)
    • 异常检测和告警
    • 定期审计日志

不应记录的内容

  • 用户密码、Token 等敏感凭证
  • 完整的身份证号、银行卡号等敏感个人信息(应脱敏)
  • 与安全无关的冗余信息(增加存储和分析成本)

追问延伸

  • 什么是 SIEM?和普通日志系统有什么区别?
  • 日志被攻击者删除了怎么办?如何保证日志的完整性?
  • 安全审计和普通的业务日志有什么区别?
  • 什么是日志的不可否认性(Non-repudiation)?如何实现?
  • 海量日志如何做安全分析?有什么方法和工具?