描述性统计 Summary Statistics
用 n、均值、标准差、中位数、范围及频数百分比描述分析人群和终点分布。
统计原理
连续变量的样本均值与样本标准差为:
均值和 SD 对极端值敏感;中位数和四分位数更稳健。分类变量百分比为某水平频数除以预先定义的分母,因此同一个 n 在不同分母规则下会得到不同百分比。
柱高表示频数;中位数和四分位数对极端值更稳健。
什么时候用
需要描述分析人群、基线特征或疗效终点的分布,而不是做组间推断时,用描述性统计。连续变量通常报告 n、Mean、SD、Median、Min、Max;分类变量通常报告 n (%)。
SAP 里长这样:
Demographic and baseline characteristics will be summarized by treatment group for the Safety Analysis Set. Continuous variables will be summarized using n, mean, standard deviation, median, minimum, and maximum; categorical variables will be summarized using frequency and percentage.
看到 descriptive statistics / n, mean, SD / frequency and percentage,即可定位到本页。
适用条件速查卡
| 项 | 条件 |
|---|---|
| 变量类型 | 连续型和分类变量均可 |
| 目的 | 描述样本,不直接回答组间差异是否显著 |
| 分析数据范围 | 示例仅纳入 SAFFL='Y' 的 ADSL 记录,每名受试者一行 |
| 连续变量 | 明确缺失值、小数位和异常值处理规则 |
| 分类变量 | 明确百分比分母及缺失是否作为类别 |
核心 SAS 代码
/* example.csv 为原创模拟 ADSL;程序只纳入 SAFFL='Y' 的受试者 */
proc import datafile="example.csv" out=adsl_raw dbms=csv replace;
guessingrows=max;
run;
data adsl;
set adsl_raw;
where saffl='Y';
run;
/* 连续变量:按计划治疗组汇总年龄 */
proc means data=adsl n mean std median min max maxdec=1;
class trt01p;
var age;
run;
/* 分类变量:组内性别构成,输出 Frequency 与 Row Pct */
proc freq data=adsl;
tables trt01p*sex / nocol nopercent;
run;
PROC MEANS的统计量和显示小数位应按 shell 规则设置,MAXDEC=只是示例。NOCOL NOPERCENT保留组内Row Pct;若 shell 使用其他分母,须调整表结构或自行计算。- 代码先冻结分析范围,再汇总,避免把未进入分析集的受试者混入分母。
变量解释表
| 变量 | 含义 | 典型来源 |
|---|---|---|
| USUBJID | 受试者唯一标识 | ADSL.USUBJID |
| TRT01P | 计划治疗组 | ADSL.TRT01P |
| SAFFL | 安全性分析集标志 | ADSL.SAFFL |
| AGE | 年龄 | ADSL.AGE |
| SEX | 性别 | ADSL.SEX |
输出对照
以下为字段定位,不预填未经 SAS 9.4 核验的数值。
PROC MEANS 汇总字段
| 输出字段 | 编号 | 对应 shell |
|---|---|---|
| N | ① | n |
| Mean | ② | Mean (SD) 中的 Mean |
| Std Dev | ③ | Mean (SD) 中的 SD |
| Median | ④ | Median |
| Minimum / Maximum | ⑤ / ⑥ | Min, Max |
PROC FREQ 交叉表字段
| 输出字段 | 编号 | 对应 shell |
|---|---|---|
| Frequency | ⑦ | 分类水平的 n |
| Row Pct | ⑧ | 分类水平的 (%) |
典型的 Table 14.1.x Demographics and Baseline Characteristics 中,连续变量填写 ①、② (③)、④、⑤–⑥,分类变量填写 ⑦ (⑧%)。
示例数据与程序
- example.csv — 20 例原创模拟 ADSL 数据
- example.sas — 数据读取、分析集限定和两类汇总程序
常见坑
常见坑
- 小数位不按 shell:Mean、SD、Median 的显示位数通常分别有规则,不能依赖过程默认值。
- 百分比分母混用:治疗组总 N、非缺失 N 和可评价 N 含义不同,必须按 SAP 定义。
- 把缺失当成 0:连续变量缺失不应参与均值;分类变量缺失是否单列需预先规定。
- 只看均值:偏态或有极端值时应同时核对 Median、Min/Max 或四分位数。
相关方法
- 方差分析 比较三个及以上独立治疗组的连续终点均值,并给出总体 F 检验和按计划的两两比较。
- t 检验(两样本/配对) 比较两个独立组的均值,或比较同一受试者两个时点的配对均值差。