数据质量
判断数据是否适合明确任务并量化偏差
CENTER 02 · RESEARCH CLUSTER 06
中心定位
数据科学不是从海量记录中寻找看起来显著的模式,而是围绕明确问题,理解数据如何生成、偏差从何产生,并用可复核的方法说明能够推断什么、不能推断什么。
数据科学与大数据分析研究中心,是第六研究集群面向数据治理、统计推断、因果识别、预测分析、复杂系统计算和可复现数据工程建设的专业研究单元。
中心围绕“研究对象是谁、数据为何被记录、哪些对象没有进入数据、字段和指标是否对应真实概念、分析假设能否成立、结论能否迁移到新时间与新场景、数据更新后是否需要修订”等问题,贯通研究设计、数据获取、质量治理、统计计算、独立验证和决策转译。
中心不以数据规模、图表数量、相关系数、P值、模型精度、处理速度或上线仪表盘直接表述科学发现和决策成效。成果按数据资源、质量报告、分析方法、统计证据、限定场景决策工具和持续运行系统分层标识。
判断数据是否适合明确任务并量化偏差
报告效应、区间、假设和不确定性
区分解释、预测、干预和优化结论
让来源、口径、处理、计算和修订可追溯
集群协同关系
本中心负责数据生成机制、质量、统计、因果、预测和大规模分析工程,不重复上一中心的智能机制与算法能力研究,也不替代下一中心对数据权利、流通和价值确认的判断。
提供经评测的模型、表征、推理输出和人机任务记录;本中心独立检验群体规律、外部效度、因果解释与决策增益
负责数据设计、质量治理、统计推断、因果识别、预测分析、复杂数据计算、可复现工程与不确定性表达
承接经过质量评价、口径定义和版本管理的数据资源或产品,另行判断权利、授权、流通、价值和合规责任
由来源中心定义对象、测量和专业意义;本中心不能仅凭数据模式替代医学、工程、农业或环境机理判断
六大研究方向
每项研究须先说明问题类型、目标总体、数据生成机制和允许的推断范围,再选择计算方法;复杂模型不能修复错误定义、系统偏差或缺失的对照。
研究调查、实验、行政记录、业务系统、传感器、遥感、互联网及第三方数据的生成机制、元数据、谱系、标准化、实体解析、缺失与异常处理;从相关性、准确性、完整性、及时性、一致性、可比性和可解释性评价数据是否适合特定用途。
研究抽样设计、估计、假设检验、贝叶斯推断、多重比较、缺失数据、测量误差和复杂调查分析;同时报告效应量、区间、不确定性来源、模型假设和敏感性,不以单一显著性阈值替代科学判断。
研究随机试验、准实验、自然实验、倾向评分、工具变量、断点、双重差分和因果图方法;预先界定处理、结果、目标人群、时间范围、混杂与干扰机制,区分相关、预测、因果效应及可执行干预。
研究分类回归、概率预测、生存分析、异常检测、时间序列、需求预测和运筹优化;采用时间外、地域外及群体外验证,评价校准、漂移、成本函数和决策后果,避免只按历史拟合优度选择方案。
研究图网络、空间统计、地理信息、遥感、面板数据、多层模型、流数据与复杂系统分析;处理空间自相关、尺度效应、网络依赖、聚合偏差和跨源对齐,使结果能够返回具体时间、空间和对象层级解释。
研究批流一体、湖仓、分布式计算、数据版本、特征与指标管理、隐私保护计算和分析流水线;在吞吐、延迟、成本、容错之外,验证口径一致、处理正确、访问受控、结果可追溯及环境可复现。
五层研究与评价平台
平台把“系统里有多少数据、模型得到多少分”推进为“数据为何适用、估计对象是谁、误差从何而来、结论能否外推、何时必须更新”的完整证据链。
把业务问题转化为明确研究问题,定义对象总体、观察单位、处理和结果变量、时间窗、比较组、决策用途、主要指标与不可接受错误
记录数据生成机制、来源授权、采样与覆盖、字典标准、时间戳、关联规则、清洗插补、版本及每次转换,形成可追溯质量档案
统一管理分析方案、代码环境、模型假设、特征、随机性和计算资源,开展估计、因果识别、预测、仿真、优化及敏感性分析
使用冻结测试数据、外部数据和独立复核,评价抽样与非抽样误差、外部效度、校准、漂移、亚组差异、替代设定与极端情形
将结论、区间、适用边界和更新规则转化为可理解的报告与决策接口,持续监测数据、指标、模型、使用行为、实际效益和误用风险
数据是否对应目标总体、研究问题和决策时点,而不只是容易获得或数量庞大
谁进入、谁缺失、选择如何发生,以及样本能否代表拟推断的人群、地点和时期
测量、录入、关联、编码、缺失和异常处理造成的误差是否被识别、量化和记录
定义、单位、分类、时间和空间口径在来源之间、版本之间和长期序列中能否比较
数据到达和更新是否满足用途,延迟、修订、漂移及源系统变化是否得到监测
用户能否理解指标含义、方法和限制,能否从结论返回数据版本、处理过程与责任主体
分阶段验证路径
后一级必须继承前一级的原始数据、字典、处理规则、分析计划、代码、环境、结果和限制记录。数据源、口径、采样、处理或用途发生变化时,须重新判断结论是否仍然成立。
明确分析要回答的问题、目标总体、受影响对象、决策主体、时间空间边界、现行基线、禁止用途和错误代价;预先区分描述、预测、因果和优化任务。
核验采集目的、授权依据、抽样与覆盖、测量工具、字段定义、时间戳、链接标识和隐私风险;识别选择偏差、测量误差、历史政策影响及数据缺口。
完成去重、关联、清洗、编码、插补和衍生指标验证,保留原始数据与处理日志;在查看主要结果前冻结主要终点、方法、排除规则、亚组和稳健性方案。
以适当基线比较统计、机器学习和规则方法,检查假设、残差、效应量、区间、校准、过拟合和数据泄漏,并报告多种合理处理方式对结论的影响。
使用新时间、新地点、新群体或独立来源复核结果,在受控流程中检验可解释性、决策增益、群体差异、成本和失败后果;必要时开展前瞻研究或随机评价。
随结果发布元数据、口径、版本、假设、不确定性和适用边界;监测源数据、指标与效果变化,按公开规则修订,保留历史版本,结论失效时暂停使用或退出。
科学、安全与成果边界
涉及个人信息、商业秘密、重要数据、跨境流动、高影响决策或弱势群体的分析,须依据具体场景落实最小必要、分类分级、访问控制、伦理审查、安全评估、结果披露和退出机制。统计分析不替代来源学科的专业判断,也不自动形成可流通或可确认的数据资产。
记录多、字段多或更新快不能证明样本覆盖目标总体;系统性缺失、数字鸿沟、重复行为和平台选择仍会产生偏差。
去重、插补、标签映射和异常删除都包含假设与判断;清洗后的整齐数据不等于真实、无偏或适合所有用途。
变量共同变化可能来自混杂、反向因果、选择或共同趋势;没有有效识别设计,不能把关联写成干预会产生的效果。
准确预测谁会发生某结果,不代表针对预测对象采取行动能够改善结果;预测目标、决策阈值和干预效应必须分别验证。
P值或置信区间不能替代效应大小、测量质量、先验合理性、重复性、成本和风险判断;多重检验和选择性报告须明确控制。
随机切分可能泄漏同一对象、时间或地点的信息;内部交叉验证良好不能证明在未来、异地、新设备或新群体中仍然可靠。
仪表盘、热力图和趋势线可以帮助观察,但坐标、聚合、缺失、平滑和筛选方式可能改变理解;图形本身不提高证据等级。
删除直接标识符、聚合或生成合成数据不保证无法重识别;链接外部数据、稀有组合和模型输出仍可能泄露个人或商业信息。