<aside> 🧭

项目简介

我在北京大学全球健康研究院参与药品研发经济学研究期间,围绕全球与中国临床试验数据,搭建了从数据获取、清洗、名称标准化、跨库匹配到统计分析的可复用工作流。项目首先校准不同注册平台的覆盖范围和统计口径,再回答中国临床试验活动、企业研发行为与药物开发阶段等问题。

</aside>

我做了什么

数据与工作流

数据来源 主要用途
ClinicalTrials.gov 临床试验编号、申办者、干预方式、适应症、阶段、状态、国家与关键日期
全球临床试验历史数据 覆盖 2007-2022 年的 393,913 条试验记录,用于历史趋势与企业匹配
CDE 申报与审评数据 中国药物申请、承办日期、通用名及首次批准上市信息
美国、欧盟、日本批准数据 补充主要市场的首次批准时间,构建上市状态变量
药企名称映射表 统一企业中英文名称、别名与核心关键词,支持跨数据库连接

代表性分析

方法与能力

Python · Jupyter · 数据清洗 · 模糊匹配 · 多源数据连接 · 时间趋势分析 · 数据口径审计

解释边界

不同临床试验平台的注册规则、覆盖国家、试验类型和更新频率并不相同。数据库中的“数量”不等于真实世界全部临床试验数量,因此结论必须限定在具体数据源和统计口径内。

项目产出