跳到主要内容
临床统计方法速查站
方法分类

描述性统计 Summary Statistics

用 n、均值、标准差、中位数、范围及频数百分比描述分析人群和终点分布。

统计原理

连续变量的样本均值与样本标准差为:

xˉ=1ni=1nxi,s=i=1n(xixˉ)2n1\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i, \qquad s=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}}

均值和 SD 对极端值敏感;中位数和四分位数更稳健。分类变量百分比为某水平频数除以预先定义的分母,因此同一个 n 在不同分母规则下会得到不同百分比。

先看分布,再选摘要

柱高表示频数;中位数和四分位数对极端值更稳健。

什么时候用

需要描述分析人群、基线特征或疗效终点的分布,而不是做组间推断时,用描述性统计。连续变量通常报告 n、Mean、SD、Median、Min、Max;分类变量通常报告 n (%)。

SAP 里长这样:

Demographic and baseline characteristics will be summarized by treatment group for the Safety Analysis Set. Continuous variables will be summarized using n, mean, standard deviation, median, minimum, and maximum; categorical variables will be summarized using frequency and percentage.

看到 descriptive statistics / n, mean, SD / frequency and percentage,即可定位到本页。

适用条件速查卡

条件
变量类型连续型和分类变量均可
目的描述样本,不直接回答组间差异是否显著
分析数据范围示例仅纳入 SAFFL='Y' 的 ADSL 记录,每名受试者一行
连续变量明确缺失值、小数位和异常值处理规则
分类变量明确百分比分母及缺失是否作为类别

核心 SAS 代码

/* example.csv 为原创模拟 ADSL;程序只纳入 SAFFL='Y' 的受试者 */
proc import datafile="example.csv" out=adsl_raw dbms=csv replace;
  guessingrows=max;
run;

data adsl;
  set adsl_raw;
  where saffl='Y';
run;

/* 连续变量:按计划治疗组汇总年龄 */
proc means data=adsl n mean std median min max maxdec=1;
  class trt01p;
  var age;
run;

/* 分类变量:组内性别构成,输出 Frequency 与 Row Pct */
proc freq data=adsl;
  tables trt01p*sex / nocol nopercent;
run;
  • PROC MEANS 的统计量和显示小数位应按 shell 规则设置,MAXDEC= 只是示例。
  • NOCOL NOPERCENT 保留组内 Row Pct;若 shell 使用其他分母,须调整表结构或自行计算。
  • 代码先冻结分析范围,再汇总,避免把未进入分析集的受试者混入分母。

变量解释表

变量含义典型来源
USUBJID受试者唯一标识ADSL.USUBJID
TRT01P计划治疗组ADSL.TRT01P
SAFFL安全性分析集标志ADSL.SAFFL
AGE年龄ADSL.AGE
SEX性别ADSL.SEX

输出对照

以下为字段定位,不预填未经 SAS 9.4 核验的数值。

PROC MEANS 汇总字段

输出字段编号对应 shell
Nn
MeanMean (SD) 中的 Mean
Std DevMean (SD) 中的 SD
MedianMedian
Minimum / Maximum⑤ / ⑥Min, Max

PROC FREQ 交叉表字段

输出字段编号对应 shell
Frequency分类水平的 n
Row Pct分类水平的 (%)

典型的 Table 14.1.x Demographics and Baseline Characteristics 中,连续变量填写 ①、② (③)、④、⑤–⑥,分类变量填写 ⑦ (⑧%)

示例数据与程序

  • example.csv — 20 例原创模拟 ADSL 数据
  • example.sas — 数据读取、分析集限定和两类汇总程序

常见坑

常见坑

  • 小数位不按 shell:Mean、SD、Median 的显示位数通常分别有规则,不能依赖过程默认值。
  • 百分比分母混用:治疗组总 N、非缺失 N 和可评价 N 含义不同,必须按 SAP 定义。
  • 把缺失当成 0:连续变量缺失不应参与均值;分类变量缺失是否单列需预先规定。
  • 只看均值:偏态或有极端值时应同时核对 Median、Min/Max 或四分位数。

相关方法

  • 方差分析 比较三个及以上独立治疗组的连续终点均值,并给出总体 F 检验和按计划的两两比较。
  • t 检验(两样本/配对) 比较两个独立组的均值,或比较同一受试者两个时点的配对均值差。