CHAPTER

第四章 正态分布与正常值范围估计

《医学统计学》

章节内容

6-1

第一节 正态分布及其性质

一群变量值可能用平均数描述集中的位置,用变异指标描述离散情况,而频数表则把变量值的分布描绘得更具体。为了直观还可把频数表画成直方图。如第四章中曾将7岁男童坐高的频数分布绘成图4.1。从图中可看出数据集中均数周围,左右基本对称,离均数愈近数据愈多,离均数愈远数据愈少的特点。医学科研中如健康人的红细胞数、血红蛋白量、血清总胆固醇,同年龄同性别儿童的身高、体重等,虽然数据各异,但画出的直方图图形是类似的。可以设想,这种类型的资料,如果调查例数无限增多,所用组距又无限的小,那么直方顶端就连成了一条光滑的曲线。这条曲线,典型地反映了这类资料的分布情况,数学上称为正态曲线,其方程为
yixuetongjixue065.jpg
式中n为总频数,X为变量值,μ为均数,σ为标准差,Y为纵高,e=2.71828……,π=3.14158……。在一个总体中n、μ、σ、e、π都是常数,只有X在变,所以Y=f(x)。
式(5.1)亦可写成:
yixuetongjixue066.jpg
由上式可看出曲线的性质:
1.曲线左右对称。X-μ无论是正或负,只要绝对值就相等,Y值就相等。所以只要X与μ的距离相等,Y就相等。Y值以X=μ为对称轴。
2.中位数、均数、众数重合。正态曲线在横轴上方。当X=μ时,e0=1,Y为极大,所以均数与众数密合。由于曲线左右对称,所以均数亦即中位数。e的指数愈大,Y愈小,但不会得负值,所以Y>0,曲线在横轴上方。
3.随着(X-μ/σ)的绝对值的增加,曲线由平均数所在点向左右两方迅速下降。
yixuetongjixue067.jpg
4.离平均数左右1σ处为曲线拐点。在μ±σ以内曲线向下弯曲,以外则向上弯曲。
这种类型的资料,数据值虽各不相同,但都有其均数与标准差,如果横轴上各以其均数为原点,标准差为单位,并令x=X-μ,那么(X-μ)/σ可写成x/σ,称为正态离差u,
yixuetongjixue068.jpg(5.2)
再令总频数为1。这时曲线以μ为原点,以σ为单位,称为标准正态曲线,其公式为
yixuetongjixue069.jpg(5.3)
以μ为均数,σ2为方差的正态分布可记为N(μ,σ2),因此标准正态分布可记为N(0,1)。
yixuetongjixue070.jpg
图5.2 标准正态曲线

6-2

第二节 正态曲线下面积

直方图是以直方的面积表示数量的。直方顶端连成曲线后,整个曲线下面积就表示总频数,用1或100%表示。一定区间曲线下面积就是出现在此区间的频数与总频数之比,或出现在该区间的各个变量的概率之和。例如以7岁男童102人为100%,则若要知道坐高在66至68cm间的人数占总人数的百分比,只要知道曲线下横坐标为66至68cm区间内的面积就可以了。因此求出曲线下面积有其实用意义。
曲线下某区间的面积,可根据曲线方程用积分求得,但若每次应用时都要用积分计算,那是很麻烦的。前人已将标准正态曲线下0至各u值的面积计算出来的了。由于各书列的方式不完全相同,所以使用时要注意表上的图示或说明,仍用7岁男童坐高资料为例说明正态曲线下面积表(附表2)的使用方法。该表左侧及上端为u值,表中数字为横轴自0至u曲线下的面积。
例5.1 根据表4.3的资料计算得坐高的X=66.72,S=2.08,试估计总体中坐高在
(1)66.72-68.80cm间。
(2)66~68cm间及(3)68~70cm间的人数各占总人数的百分比。
(1)求坐高在66.72~68.80cm 之间曲线下面积。
①求u(u=(X-μ)/σ,这里分别以X、S作为μ与σ的估计值)
(66.72-66.72)/2.08=0
(66.80-66.72)/2.80=1
标准正态曲线下面积见图5.3(a)。
②查附表2,u自0至1的面积,即查u=1.00,得α/2=0.3413。坐高在此区间内的人数占总人数的34.13%。
(2)求坐高在66~68cm之间曲线下面积。
①求u
(66-66.72)/2.08=-0.346
(68-66.72)/2.08=0.615
标准正态曲线下面积见图5.3(b)
②查附表2 u=0.346,得α/2=0.1353(经内插法求得,下同)
u=0.615,得α/2=0.2308
0.1353+0.2308=0.3661
坐高在此区间内的人数占总人数的36.61%,即102×0.3661=37.3人,与实际观察所得38人相近。
yixuetongjixue071.jpg
图5.3 正态曲线下面积之计算
(3)求坐高在68~70cm间的人数占总人数的百分比。
①求u
(68-66.72)/2.08=0.615
(70-66.72)/2.08=1.577
标准正态曲线下面积见图5.3(c)
②查附表2, u=1.577,得α/2=0.4426
u=0.615,得α/2=0.2308
0.4426-0.2308=0.2118
坐高在此区间内的人数点总人数的21.18%,即有102×0.2118=21.6人。与实际观察所得20人相近。
从例5.1可见,因为正态曲线对称于原点,所以不论u为正还是负,绝对值相同时,自0至u的面积相同。查附表2时,若两个u值中有一个是0,按另一u值查得α/2;若两个u异号,将查出的两个α/2值相加;若两个u同号,则将大的α/2值减去小的即得。但不能将两个u值相加(或减)后再查面积。
例5.1已求得u从0-1时,α/2=0.3413,所以u从-1~1,曲线下面积为0.6827,说明有68.27%的变量值在μ±σ的范围内(见图5.2)。查附表2,当u=1.96时,α/2=0.475,因此μ±1.96σ的范围内包含有95%的变量值,只有5%的变量值在此范围外。由于曲线左右对称,因此有2.5%的变量值等于或小于μ-1.96σ;2.5%变量值等于或大于μ+1.96σ。同理,查附表2,u=2.58时,α/2=0.495,因此μ±2.58σ范围内有99%的变量值,在此范围外的仅占1%。u=1.96和u=2.58(准确说是u=2.5758)是正态分布中两个重要的界值,称5%界和1%界,今后在正常值范围估计、假设检验等中常常要用到。
如果已知资料呈正态分布,那么理论上只要知道μ和σ就可根据曲线下面积表求出任两值之间变量值的个数,也就是说能算出变量值的频数分配。但实际上μ和σ常常无法获得,因此只能用X和S作为μ和σ的估计值,来估计总
体中变量值(个体值)的分布。

6-3

第三节 正常值范围的估计

在医学科研中有时需要根据样本数据推论总体中个体值范围,其中最常用的是估计正常值范围。

6-3-1

一、正常值范围的意义

正常人体的解剖、生理、生化、心理等各种数据的波动范围称正常值范围,简称正常值。如成人白细胞总数的正常值为4000~10000个/mm3。以一定数量“正常人”为样本,观察某个或几个变量,根据所得样本数据,推论总体中变量值的范围,称正常值范围估计。一些与人体有关的外界环境如噪音强度、粉尘浓度、昆虫密度、水中微量元素的含量等,在某一地域、某段时期内亦在一定范围内波动;某病患者在病程的某段时期内,某种检验结果亦常在一定范围内波动。虽然这些范围不一定是正常的,有的超过了卫生标准或正常值,但若从样本数据估计总体中变量值的范围来说,那么也可以用本章的估计方法,得出的波动范围可称为个体值范围。

6-3-2

二、确定正常值范围的一般原则和步骤

1.确定研究总体。即对研究总体的同质性基础作出规定。以“正常人”为例,所谓正常人不是指任何组织与器官的形态及机能都无异常的人,而是指排除了影响被研究指标的疾病和有关因素的人。例如某单位研究血清谷一丙转氨酶活性的正常值,选取“正常人”的条件为无肝、肾、心、脑、肌肉等器质性疾患,近期无特殊用药史(如氯丙嗪、异烟肼等),测定前未作剧烈运动等。上述条件就是保证研究对象的同质性作出的规定。但不允许以所研究指标值的大小来划分是否“正常人”。对研究总体,如“正常人”的规定要根据研究目的、技术力量与水平以及人力物力等条件来考虑,往往牵涉到多方面的专业知识。但一般可从地区、民族、性别、年龄、劳动条件(如是否与有害物质接触)、时间(季节与昼夜)、月经、妊娠、饮食、药物、生活习惯等来考虑。例如红细胞数及血红蛋白量,高原居民与平原不同,男子各异;人体血清胆固醇含量随年龄的增长而增加,妊娠期高于非妊娠期,冬季高于夏季,且受饮食影响;服用某些药物可直接增加检测的有关成分或干扰检测结果的准确性。
各种影响因素,有些可通过询问与体检严格控制,如排除那些与被研究指标有关的各病患者,或处于妊娠、经期的妇女,近期内服用某种药物者等;有些可用对调查资料分组统计的办法加以控制或研究。如先按男、女分别统计,然后检验两组数据的分布、均数与标准差等,有无差别,若有差别则分别求正常值,否则可合并求通用的正常值。
2.确定观察例数。正常值范围的影响因素复杂,要使样本分布能正确估计总体分布,例数不能太少,一般认为应在200例左右。数据变异不大,观测比较精确的,例数可相应少些;影响因素复杂、数据变异大,观测方法不够稳定的,例数相应要多一些。但要防止片面追求数量,而抽选样本不按规定,观测方法不统一,粗率马虎,以致影响原始数据的可靠性。
3.统一测定方法,控制实验误差,保证数据的可靠性。为达到上述要求应注意对检测人员(医生、检验人员等)的培训,以统一认识、统一方法和操作,标准化仪器和试剂,建立质量控制防止记录差错等。但也要尽量与应用正常值范围时的实际情况相一致,例如临床检验每一个标本只作一次,那么为确定正常值的检验每个标本亦只作一次,不能作两个平行样本求平均数后再估计正常值。否则可能定出的正常值范围较窄。
4.确定取单侧还是双侧界值。某些指标如白细胞总数,无论过低或过高都不正常,因此需要确定下限和上限两个界值,称双侧界值。有的指标如肺活量一般只认为过低是不正常,所以只需定下测界值,即下限;但血铅只是过高不正常,只需定上限。只需定下限或上限的,称单侧界值。确定取单侧还是双侧界值,应根据业务知识与指标用途。
5.确定适当的百分范围。调查一定数量的正常人若以某指标的最小、最大值作为正常值范围,常因调查例数的增加等遇到少数极端值,使正常值范围不稳定。因此统计上常采用一些方法,删去一定比例的极端值,使得出的正常值能较稳定地反映绝大多数正常人该指标的数值。那么绝大多数是指正常人的百分之多少呢?一般包括正常人的80%、90%、95%或99%等。这样,若按单侧计算,相应地将有20%、10%、5%或1%的正常人该指标值在正常值范围以外;若按双侧计算,相应地,过高、过低者各有10%、5%、2.5%或0.5%。这些指标值在正常值范围以外的正常人,将被错判为不正常。将正常错判为不正常,称为I型错误,或假阳性,其假阳性率或误诊率用α表示。但亦有些病人的指标值,可能落在正常值范围以内,这时就会将病人错判为正常人,这种错判Ⅱ型错误,或假阴性,假阴性率即漏诊率用β表示。确定合适的百分范围应根据研究目的,结合正常人和病人的数值分布,同时考虑α及β,一般有下列两种情况:
(1)正常人和病人的数据分布无重叠(见图5.4a)。这时只考虑减少α;
(2)正常人和病人的数据分布有重叠(见图5.4b)。这时两分布重叠部分内既有病人亦有正常人,若欲减少α,界值向右移,那么β将加大;若欲减少β,界值向左移,那么α将加大。通常兼顾α及β,取两曲线交点的横座标为界值,这时α与β之和为最小。但实用时还要考虑该正常值范围的主要用途,若用以普查初筛病人,则要减少假阴性,取80%或90%正常值范围;若用以确诊病人,则要避免假阳性,以取95%或99%正常值范围为宜。
yixuetongjixue072.jpg
图 5.4 正常人和病人数据分布示意图
6.确定估计方法进行估计。估计正常值范围的方法较多,主要根据频数的分布类型和样本含量选用。常用的有百分位数法和正态分布法。运用百分位数法的条件是样本含量大,适用正态分布法的条件是资料服从正态分布或经过转换后服从正态分布。此外尚有曲线拟合法等。

6-3-3

三、确定正常值范围的方法

1.百分位数法。本法根据正常人样本数据,按照选定的百分范围计算相应的百分位数作为正常值范围的界值。可根据原始数据直接计算,亦可根据频数表进行计算。计算步骤为: (1)按已确定的百分范围从表5.1查得应计算的百分位数; (2)计算出各百分位数的所在位置; (3)代入公式计算界限Px 表5.1 估计正常值范围的计算项目
百分范围(%)百分位数法正态分布法
双侧单侧  下(或上)限双侧单侧 下(或上)限 
80P10及P90P20(或P80)X±1.282SX-(或+)0.842S
90P5及P95P10(或P90)X±1.645SX-(或+)1.282S
95P 2.5及P97.5P5(或P95)X±1.960SX-(或+)1.645S
98P1及P99P2(或P98)X±2.326SX-(或+)2.054S
99P0.5及P99.5P1(或P99)X±2.576SX-(或+)2.326S
例5.2 某地测得200例健康成人的血铅值(微克/100克)得频数分布如下,试估计单侧95%上限。 (1)查表5.1,百分范围95,百分位数法,单侧上限应求P95。 (2)求P95的位置200×0.95=190即为第190个数据处,因此知A=188,Lx=35,fx=4,ix=5。 代入公式(4.5) 表5.2 百分位数法计算单侧上限(200例健康成人的血铅值)
血铅值(微克/100克)频数累计频数
0-66
5-4854
10-4397
15-36133
20-28161
25-13174
30-14188
35-4192
40-4196
45-1197
50-2199
55-0199
60-1200
合计200-
yixuetongjixue073.jpg yixuetongjixue074.jpg 健康成人血铅值的95%正常值上限为37.5微克/100克。 若根据原始资料计算,已算得Px的位置为第190个数据后,将原始数据从大至小排,第10个数据的值即为Px。 此法的优点是不拘资料的分布类型,计算简便,样本含量较大,分布较稳定时结果稳定。但估计结果受样本极差的限制,受两侧尾部数据的影响较大,尤其是百分范围较大(如大于95%)。样本含量不够在时,结果不够稳定。 2.正态分布法。正态分布法运用正态曲线下面积与μ±μασ的关系来估计数值范围的。在图5.2中曾提到μ±1.96σ的范围内包含了曲线下总面积的95%,亦就是总例数的95%。在此范围外则有2.5%的例数其数据值大于μ±1.96σ,另2.5%小于μ-1.96σ。因此,就可用μ±1.96σ来估计双侧95%的正常值范围。同理可用μ与相应的μασ 估计所需百分范围,μ可从附表2查得。但在实际中μ与σ常常是不知道的,只能用它们的估计值X与S 来代替。估计正常值范围时常用的百分范围与相应的X±us见表5.1。用正态分布法估 计正常值范围的公式为 X±uαs (5.4) 例5.3 测得西安市7岁男童102人坐高,X=66.72,S=2.08,试用正态分布法估计 双侧95%正常值范围。 查表5.1,百分范围95,正态分布法双侧,应求X±1.96S。 代入公式(5.4) 66.72±1.96×2.08=(62.6432,70.7968) 西安市7岁男童坐高的95%正常值范围为62.6~70.08公分。 此法适用于正态分布资料,样本均数和标准差比较稳定者,其优点是结果稳定,受两端尾部数据影响较小,也不受样本数据极差的限制,缺点是只适用于正态分布资料。医学上不少资料呈偏态分布,但计算较繁。
6-4

练习题

1. 2.调查得成都市1979年996名女学生月经初潮年龄的分布如下,本资料宜用何法确定其双侧99%正常值范围?试估计之。
年岁1011121314151617181920合计
人数7441532442691916116812996
3.某市20岁男学生160人的脉搏数(次/分钟),经正态性检验服从正态分布。求得X=76.1,S=9.32,试估计脉搏数的95%、99%正常值范围。 4.已知238例正常人发汞值(μg/g)的最后14个发汞值如下,求95%单侧上限。
发汞值……2.62.62.62.62.72.72.72.82.83.03.34.04.14.3
秩次……225226227228229230231232233234235236237238