CHAPTER

第三章 平均数与变异指标

《医学统计学》

章节内容

5-1

第一节 平均数

5-1-1

一、频数表的编制与频数分布

计量资料有离散型变量和连续型变量。对离散型变量,可列出变量值及其频数如表4.1。若变量值较多时,亦可用组段表示如表4.2。每个组段的起点称下限,终点称上限,上限与下限之差称组距。如表4.2第一组的下限是0,上限是1。第二组的下限是2上限是3,组距都是1。归组以后,该组的变量值用组段的中值代表,称组中值。如第一组的组中值为0.5。 表4.1 某市居民1095天中每天意外死亡人数(1980~82年)
死亡人数天数
0807
1250
231
35
40
50
60
71
80
151
合 计1095
表4.2 204名轧钢工人白细胞中大单核所占百分比
大单核数(个/每百白细胞)人数
0-124
2-340
4-555
6-737
8-927
10-1118
12-131
14-150
16-171
18-190
20-211
合计204
若是连续型变量,组段的写法与离散型变量的略有不同。如表4.3坐高第一组段下限为61,上限为62;第二组段的下限为62,上限为63。因此,上一组段的上限和下一组段的下限值相同。为便于归组,上限一般不写出来。如第一组写成“61-”,意思是凡坐高在61至未离散型变最的数值较大时,亦可按连续型变量写组段,如红细胞数(万/mm3)的组段应写成400-419,420-439,…,亦可简化写成400-,420-,…。这样由组段和频数两部分组成的表称为频数表。下面用表4.4资料说明频数表编制步骤。?? 表4.3 某市7岁男童坐高频数表 yixuetongjixue031.jpg 表 4.4 西安市7岁男童102人的坐高,cm
64.463.864.566.866.566.368.367.268.067.9
63.264.664.866.268.066.767.468.666.866.9
63.261.165.065.066.469.166.866.467.568.1
69.762.564.366.366.667.865.967.965.969.8
71.170.164.966.167.366.865.065.768.467.6
69.567.562.462.666.567.264.565.767.065.1
70.069.664.765.864.267.365.065.067.270.2
68.068.263.264.664.264.565.966.669.271.2
68.370.865.364.268.066.765.666.867.967.6
70.468.464.366.067.365.666.066.967.468.5
68.369.7        
(一)找出原始资料中的最小、最大值 表4.4坐高的最大值为71.2cm,最小值为61.1cm,最大值与最小值之差称极差为10.1cm。 (二)定组距 先考虑组数。资料在100例以上的一般分10-15组。若例数较少,组数可相应少些;例数很多,组数可酌情多些,以能显示分布的规律为宜。此例拟分10组。将拟分的组数除极差(10.1/10≈1)得组距的约数。再调整到较方便的数如0.1、0.2、0.5,1、2、5、10、20、50……等。此例取组距为1。 (三)写组段 取等于或略小于最小值的整数为第一组的下限。按组距依次写出各组段的下限及短横,见表4.3组段行,注意短横“-”不能略去。 (四) 划线记数 像选举开票那样,将变量值逐个归入相应的组段,如将64.4归入“64-”组,63.8归入“63-”组。每归入一个变量值,在相应的组段内划一竖线,每逢第五线则作一横线跨在已划出的四条竖线上,这样五线连在一起最后计数时就很方便了。划完后将每个组段内的线条数写出,再将各组频数合计,频数表就编好了。 若事先不能确定合适的组数,可先分细些,需要时再将相邻两组合并。而分粗了,再要分细,则只得重划。 表4.4的资料编成频数表(见表4.3)后,可看出变量值的分布情况,若绘成直方图就更直观。从图4.1可看到横坐标约为66.5cm处直方最高,表示变量值围绕在66.5左右的最多;两侧对称下降,大于66.5和小于66.5的变量值个数基本相等。这种类型的分布为对称分布。第五章介绍的正态分布是其中最常见的一种。 yixuetongjixue032.jpg西安市7岁男童坐高分布 图4.1 西安市7岁男童坐高分布 此外,如图4.2,变量值愈小频数愈多图形呈“L”形,图4.3的频数集中在变量值较小的一边,右侧尾部拖得很长。后两种属偏态分布。这三种频数分布都只有一个高峰称单峰分布。为更准确地说明分布的特征,对形状相同的分布作出集中位置和离散程度的比较,就需计算频数分布的一些特别值。如平均数、百分位数、极差、标准差、变异系数等。 yixuetongjixue033.jpg某市1095天中居民意外死亡人数(1980-1982) 图4.2 某市1095天中居民意外死亡人数(1980-1982) yixuetongjixue034.jpg204名轧钢工人白细胞中大单核所占百分比 图 4.3 204名轧钢工人白细胞中大单核所占百分比
5-1-2

二、众数、中位数、百分位数的意义及计算法

(一)众数 出现次数最多的变量值,或频数表上频数最多组的组中值即为众数。如表4.3中坐高的众数是66.5cm。这样仅由观察所得的众数称为观察众数。同一资料常因所用组距不同和下限取值不同,观察众数稍有出入,故又称概约众数,与观察众数相对应的尚有理论众数。理论众数的算法根据频数曲线类型的不同而异,数学上为与极大值相应的横坐标。
(二)中位数及百分位数
1.中位数 将n个变量值从小到大排列后,居中的一数就是中位数,符号为M,有的书上用Md。它将变量值分为两半,一半比它小,一半比它大。
X1<X2<…<M<…Xn-1<Xa
当n为奇数时
yixuetongjixue035.jpg      (4.1)
当n为偶数时
yixuetongjixue036.jpg(4.2)
当资料呈明显偏态,或有个别的特小、特大值存在时,中位数的代表性往往比均数好。例如有5个变量值8、9、9、10、19。其中4个在9左右,但由于受数值19的影响,均数为11,不能很好代表中等水平。求中位数
yixuetongjixue037.jpg
比较符合实际。
根据频数表计算连续型变量的中位数可用式(4.3)或式(4.4)
yixuetongjixue038.jpg(4.3)
或    yixuetongjixue039.jpg(4.4)
式中L、U分别为中位数所在组的下限及上限,A1为小于L的各组的累计频数,A2为大于U的各组的累计频数,fM、i分别为中位数所在组的频数和组距。现用表4.5说明计算步骤如下:
(1)求出中位数的位置。在频数表上,数据已由小到大排好了。中位数将频数等分为2,因此先计算n/2,得中位数的位置。
n/2=157/2=78.5
(2)列出频数表、计算累计频数。列频数表时,组段的短横“-”写在两个组段下限之间,其意义仍与写在右边的相同,见表4.5第(1)栏。
第(3)栏为累计频数。此例自上而下累计到略小于n/2为止得A1=41,表示住院天数为10天及以下的有41个人。若要知道第78.5人的变量值,就需要从10-15组内再累计(78.5-41=)37.5人。假定该组的49人在10-15天内均匀分布着(见图4.4),那么只要在10天上再加(78.5-41)/49个组距便是中位数了。所以
yixuetongjixue040.jpg
用符号表示见式(4.3)。
若将频数自下而上累计到略小于n/2为止,则得A2=67。也得出中位数在10-15组段内。
yixuetongjixue041.jpg
图4.4 中位数计算示意图
(3)写出L或U、fM及i。
(4)代入公式得M。
例4.1 求杆菌痢疾治愈者157名住院天数的中位数。
n/2=157/2=78.5
表4.5 杆菌痢疾治愈者的住院天数
yixuetongjixue042.jpg
L=10或U=15,fM=49,i=5。
代入公式
yixuetongjixue043.jpg
杆菌痢疾治愈者住院天数的中位数为13.8天。
中位数既然把频数等分为二,所以从另一端算起,用式(4.4)可得到同样的结果。
此例若计算治愈者平均住院天数得17.9天。从频数表上可看到157名患者中住院天数少于15天的就有90名,占57.3%,因此中位数13.8天的代表性优于均数17.9天。
2.百分位数 中位数将频数等分为二,亦称二分位数。若将频数等分为四,则称四分位数,共有三个四分位数,即第一、第二、第三四分位数。第二四分位数即中位数。同理,将频数等分为十或一百的分位数称十分位数或百分位数。其实上述各种分位数都可用百分位数表示。百分位数的符号为Px,X代表第X百分位。例如第一四分位数、中位数可分别以P25、P50表示。计算百分位数的方法与中位数相似,只是式(4.3)中的n/2以nx/100代替,M以X代替。
yixuetongjixue044.jpg   (4.5)
式中LX、fx、ix分别为Px所在组的下限、频数及组距。A为小于Lx各组的累计频数。
例4.2,求例4.1中住院天数的P90。
(1)计算  yixuetongjixue045.jpg
(2)累计频数自上而下至略小于141.3,见表4.5第(4)栏,得A=135。知P90在30-35组内,因此Lx=30,i=5,fx=7
(3)代入公式
yixuetongjixue046.jpg
第90百分位数为34.5天,说明有90%的患者住院天数在34.5天以下。

5-1-3

三、算术均数与几何均数的意义及计算方法

(一)算术均数 简称均数。设观察了n个变量值X1,X2,……Xa,一般可直接用式(4.6)求样本均数X。 yixuetongjixue047.jpg 式中∑是总和的符号,n是样本含量即例数。本书在不会引起误解的情况下简写成 X=1/n∑X (4.6) 例4.318-24岁非心脏疾患死亡的男子心脏重量(g)如下,求心重的均数。
350320260380270235285300300200
275280290310300280300310310320
X=1/20(350+320+…+320)=5875/20=293.75g 样本均数是总体均数的估计值,它有两个特性。(1)∑(X-X)=0,(2)∑(X-X)2为最小,前者读者 可自证,后者证明如下: 设:a≠X,则a=X±d d>0 ∑(X-a)2=∑(X-X±d)2    =∑[(X-X)±d]2  =∑(X-X)2±2d∑(X-X)+Nd2 从第一个特性知∑(X-X)=0,因此2d∑(X-X)=0, 得 ∑(X-a)2=∑(X-X)2+Nd2 N是例数,不可能为负,所以Nd2也不会是负数。 ∑(X-a)2>∑(X-X)2,∑(X-X)2为最小。 当用电子计算机处理大量实验数据,考虑到有较大舍入误差时,则先取一较近均数的常数c ,然后用式(4.7)计算,可提高均数的精度。 X=C+1/n×(Xi-C)      (4.7) 若每输入一个变量值后都希望得到均数,那么可用式(4.8) X=X n-1+1/n×(Xn-Xn-1    (4.8) 例4.4 仍用例4.3资料,已算得前19例心重的X10=292.37,又测得X20=320,求X20。 X20=292.37+1/20×(320-292.37)=293.75g 若相同的变量值个数较多,或对频数表资料求均数时,可用式(4.9)计算X。  或简写为X=1/n∑fX (4.9) 式中K为不同变量值个数,或频数表中的组段数。Xi为第i个不同的变量值或频数表上的组中值,fi为第i个变量值的频数。 例4.5 计算表4.5菌痢治愈者的平均住院天数。 X=1/157(3×2.5+38×7.5……+1×77.5)=17.9天 式(4.9)中某变量值的频数愈大,则该变量值对X的影响亦愈大。因此,频数又称权数,这样 计算出来的均数又叫加权均数。亦有根据变量值的重要性进行加权,计算加权均数的。 (二)几何均数 设n个变量值X1,X2,……,Xa呈对数正态分布,其几何均数G为 yixuetongjixue049.jpg 式中∏为连乘的符号。当变量值较多时,乘积很大,计算不便,常改用下式计算 yixuetongjixue050.jpg(4.10) 或    yixuetongjixue050.jpg(4.11) 式中符号含义同式(4.6)与式(4.9)。 例4.6 求下表中麻疹病毒特异性IgG荧光抗体的平均滴度。 表4.6 52例麻疹患者恢复期血清麻疹病毒 特异性IgG荧光抗体滴度
IgG滴度倒数例数
403
8022
16017
3209
6400
12801
G=log-1[1/52×(3log40+22log80+…+log1280)]=129.3 麻疹患者恢复期血清麻疹病毒特异性IgG荧光抗体的平均滴度为1:129。 式(4.10)包含三个步骤,(1)令Xi=logXi,则式(4.10)可写成 ;(2)1/n∑Xi 即对数数值的均数X;(3)将X取反对数即得几何均数1og-1X=G。这里不难理解,若将这种资料作对数变换后,即可用式(4.6)至式(4.9)的各式计算均数,得到结果后再取反对数即得几何均数。读者可自已验证。
5-1-4

四、运用平均数的注意事项

平均数是描述一群同质变量值集中位置的特征值,用来说明某现象或事物数量的中等水平。通常用平均数作为算术均数、几何均数、众数、中位数等的统称,而以均数作为算术均数的简称。 1.同质的事物或现象才能求平均数 我们检查200名正常人的红细胞数(万/mm3)计算平均数,定出正常值范围,作为诊断贫血的依据之一。如果正常人中混有贫血患者,那么求出的平均数既不能说明正常人也不能说明贫血患者,有人把它称为虚构的平均数,因为它模糊了数量特征,不能提供分析的依据了。因此计算平均数以前必须考虑资料的同质性。有人研究某药物的利尿作用,观察了二条狗、三头兔子用药前后的排尿滴数,曾将狗与兔子的排尿滴数加在一起求平均数。由于狗体大,排尿滴数较兔子的多,得到的平均数对狗来说似嫌少,而对兔子来说又显得太多,这是虚构平均数的又一例。 像狗与兔子,贫血患者与正常人的不同质是显而易见的。但即使是正常人,性别、年龄、地区不同,红细胞数的均数也有差异。那么怎样才算是同质呢?是否同质,要根据研究目的而定。例如研究痢疾患者的平均治愈日数时,要考虑不同病原菌、不同型别(急性、慢性等)的患者是不同质的。但当研究传染病的住院日数时,则不同疾病(痢疾、伤寒、……)是不同质的,而所有痢疾病人,不论由何种病原菌引起,或是何种型别都认为是同质的了。若研究各医院的平均住院天数时,医院类型(传染病院、儿童医院、综合医院、……)以及同类医院中,科室(内、外、传染……)设置及床位分配不同等就是不同质的了。不同质的事物就要分组求平均数,以便分析比较。因此科学的平均数是建立在分组的基础上的。 2.用组平均数补充总平均数 表4.7是某院1983年的治愈者平均住院天数。总均数为18天。但从表中可见,它所包含的20类(其他类除外)的疾病中,变态反应及中毒、小儿科疾病住院天数最短为9天,而结核病的却长达60天。住院天数高于总均数的有10类,治愈人数共1358人,占治愈总人数(其他类除外)的35%。若医疗质量基本不变,多收结核病人,住院天数的总均数无疑会延长;而多收小儿患者,总均数就会缩短。因此如没有收容病种的分析,仅从总均数的延长或缩短来看医疗质量是不科学的。而对各时期同种疾病的住院天数进行分析,比较适宜。 表4.7某医院1983年各类疾病治愈者的平均住院天数
病类治愈人数平均住院天数病类治愈人数平均住院天数
传染病寄生虫病43713外科疾病54918
结核病10960外伤38328
呼吸系疾病24614肿瘤6534
消化系疾病25524眼科疾病11214
内分泌疾病4135耳鼻喉科疾病41710
循环系疾病3437口腔科疾病3012
血液及造血系统疾病733皮肤科疾病22422
神经系疾病11125妇产科疾病7812
变态反应及中毒439小儿疾病6019
风湿病2110其他3519
泌尿系疾病12921合计392718
3.根据资料的分布选用适当的平均数 计量资料如是单峰对称分布,宜用均数,亦可用中位数。若是偏态分布则中位数的代表性常较均数为好。某些传染病的潜伏期、抗体滴度、细菌计数、率或比的变化速度及某些物质浓度等,其频数分布明显偏态,但经对数代换后近于正态分布的,如图4.3资料,应计算几何均数以描述其中等水平。
5-2

第二节 变异指标

5-2-1

一、变异指标的意义及种类

设有甲乙两人,对同一名患者采耳垂血,检查红细胞数(万/mm3),每人数五个计数盘,得结果为
      合计均数
4804905005105202500500
4404605005405602500500
两人计数的均数都是500,能说两人的检验技术相同吗?不能,因为甲的计数结果比较密集,而乙的分散,因此甲的检验精度显然比乙的高。从上可以看出:描述一群变量值,除用平均数等表示其集中位置外,还要说明其分散或变异情况。说明变异情况的特征值称变异指标。变异指标的种类较多,下面分别介绍极差、四分位数间距、均差、方差、标准差及变异系数。 1.极差 最大值与最小值之差称极差(或全距),符号为R,是变异指标中最简单的一种。如上例甲计数的极差为520-480=40,乙的为560-440=120。可见乙的计数较甲的波动大。一般把最小值与最大值写在括号里,附在极差的后面。如上例写成40(480~520)与120(440~560)。其单位与变量值的相同。 当调查例数增多时,遇到较大或较小极端值的机会就加大,因此最大值与极差随着例数的增多而加大,但最小值却随着例数的增多而变小。 极差计算简便,但只考虑了最小、最大值,因此易受个别极端值的影响,且随例数的多少而变动,不稳定。仅用于粗略地说明变量值的变动范围。但在正态分布中可用以估计标准值范围,详见有关文献。 2.四分位数间距 极差的不稳定主要是受两极端数值的影响,于是有人将两端数据按比例去掉一定例数,这样所得数据就比较稳定了。例如两端各去掉25%,取中间50%数据的数值范围,那么只要计算P25与P75,求P75与P25之差即得四分位数间距,符号为Q。 Q=P75-P25 (4.12) 例4.7 试计算表4.8七岁男童坐高的四分位数间距 求 P25的位置102×.25=.25.5. 求 P75的位置102×.75=.76.5. 求累计频数得: L25=65,L75=68, A25=22,A75=75, f25=15, f75=13,i=1 表4.8 7岁男童的坐高
坐高(cm)例数(f)累计频数
61-11
62-34
63-48
64-1422
65-1537
66-2158
67-1775
68-1388
69-795
70-5100
71-2102
合计102
代入式(4.5)得: yixuetongjixue052.jpg Q=68.12-65.23=2.89 cm 有50%的7岁男童,坐高在65.23~68.12cm之间,其四分位数间距为2.89cm。 3.均差 四分位数间距虽比极差稳定,但仍只是两点之间的距离,没有利用每个变量值的信息。于是有人计算每个变量值与均数(或中位数)差的绝对值之和,然后平均称为均差(或平均直线差)作为变异指标之一。 yixuetongjixue053.jpg  (4.13) 例4.8 试计算4.3中,心重的均差。 由例4.3知X=293.75g,代入式(4.13)得 yixuetongjixue054.jpg 4.方差 式式(4.13)中用变量值与均数之差的绝对值之和∑∣X-X∣,而不用离均差之和∑(X-X)是因为∑(X-X)=0,不能说明变异情况,故取绝对值以去掉负号。亦有人用平方的办法,即用离均差平方和∑(X-x )2,既去掉了负号,又提高了指标的灵敏性。因为数值愈大,平方后增大的愈多,所以离均差稍有变化,就能从指标上反映出来。例如有甲乙两组数据如下:
      X∑∣X-X∣∑(X-X)2
甲组101112131412610
乙组91212131412614
乙组仅有两个数据与甲组的不同,这种不同从∑∣X-X∣或均差上是反映不出来的,但从∑(X-X)2上却反映出来了。以∑(X-X)2组成的变异指标有方差与标准差。方差是标准差的平方,将在第八章讨论,下面先介绍标准差。
5-2-2

二、标准差

1.标准差的公式 样本标准差是用得最多的变异指标,其公式为
yixuetongjixue055.jpg (4.14)
式(4.14)中的n-1是自由度。n个变量值本有n个自由度,但计算标准差时用了样本均数X,因此就受到了一个条件即∑X= nX的限制。例如有4个数据,它们的均数为5。由于受到均数为5的限制,4个数据中只有3个可以任意指定。如果任意指定的是4、3、6,那么第4个数据只能是7,否则均数就不是5了。所以标准差的自由度为n-1。
2.标准差的计算
(1)按基本公式(4.14)计算
例4.9 用例4.3资料计算心重的标准差。
已算得X=293.75g,代入式(4.14)得
yixuetongjixue056.jpg
(2)递推法当用电子计算机进行计算,希望每输入一个数据,都能得到X与S,则将式(4.8)与式
(4.5)配合计算。
yixuetongjixue057.jpg(4.15)
这里Sn表示n个数据的标准差,Sn-1表示n-1个数据的标准差。Xn是第n个数据,Xn-1是n-1个数据的均数。
例4.10 仍用例4.3资料,已算得前19例心重的X19=292.37,S19=38.71。X20=320,代入式(4.15)得
yixuetongjixue058.jpg
(3)直接法 不需先计算均数,直接用变量值代入式(4.16)或式(1.17)计算。
yixuetongjixue059.jpg(4.16)
或  yixuetongjixue060.jpg(4.17)
式(4.16)的分子是由式(4.14)的分子简化而得来的,证明如下。
yixuetongjixue061.jpg
例4.11用ELISA(酶联免疫吸附测定)法检测vero-E6,细胞培养上清正常标本10份的结果(100XOD490值)为2,3,3,4,4,5,5,5,6,8,求标准差。
若用式(4.16)则先计算
∑X=2+3+3+…+6+8=45
∑X2=22+32+32+…62+82=229
若用式(4.17)则先计算
∑fX=1×2+2×3+…+1×6+1×8=45
∑fX2=1×22+2×32+…1×62+1×82=229
然后代入式(4.16)或式(1.17)结果相同。
yixuetongjixue062.jpg

5-2-3

三、变异系数

上述各种变异指标可用来比较同类事物变量值间的变异情况。各变异指标的共同点是:值小表示变量值密集,值大表示变量值分散。但在有些情况下用标准差等变异指标来比较就不适宜了。如某地7岁男童身高均数为123.10cm ,标准差为4.71cm;体重的均数为22.29kg,标准差为2.26kg。由于单位不同,我们不能因为4.71>2.26而说身高的变异大于体重,需要有另一个指标,它不受单位的限制,那就是变异系数,其公式为: CV=S/X×100%,X>0    (4.18) 也就是将标准差化为各自均数的百分数,然后比较。这样不但可以比较单位不同的变量值间的变异,而且可以比较均数相差悬殊的变量值间的变异。 上述7岁男童身高、体重的变异系数分别为 身高CV=4.17/123.10×100%=3.83% 体重CV=2.26/22.29×100%=10.14% 可见同一批儿童的体重变异比身高的大。 例4.12被试者9人,试验时坐在舒适的牙科椅上测口腔压力波幅PcmAq(厘米水柱)。然后外加呼吸阻力20cmAq(1/sec),5分钟时再测口腔压力波幅结果如下。试比较外加呼吸阻力前后,口腔压力波幅的变异。 表4.9 外加呼吸阻力前后的口腔压力波幅 口腔压力波幅,cmAg
口腔压力波幅,cmAg
XSCV(%)
加阻力前1.2180.25621.019
加阻力后7.2400.6338.741
外阻力前口腔压力波幅的变异较大。 外加呼吸阻力前后的口腔压力波幅的单位都是cmAq,如直接比较两个标准差,可能会得出加阻力后数值变异较大的结论。但由于两均数相差悬殊,加阻力后的均数几乎是加阻力前的6倍,因此就不宜直接比较标准差而应比较它们的变异系数。 变异系数还常用于比较多个样品重复测定的误差等。 运用变异系数时应注意(1)有关的事物间才能作比较,不要将风马牛不相及的东西硬拉在一起作比较;(2)均数小于标准差时应考虑其实际运用价值。因为在这种情况下,可能誇大变异,故不宜使用;(3)比较两变异系数间是否真有差别,亦应作假设检验,不能只看表面值就下结论。 [附]比较两变异系数可用u检验,其公式为 yixuetongjixue063.jpg 式中V为以小数表示的变异系数,SV2是变异系数的标准误的平方,n是样本含量。u是正态离差系数。 例4.13比较例4.12中两总体变异系数间有无差别。 H0:两总体变异系数相等 H1:两总体变异系数不等 α=0.05 yixuetongjixue064.jpg u>u0.05,0.05>P>0.01,在α=0.05的水准处拒绝H0,接受H1,两总体变异系数不等。外加呼吸阻力前的口腔压力波幅的变异较大。
5-2-4

四、运用变异指标的注意事项

1.变异指标表示变量值的变异情况或离中趋势,常与位置指标平均数结合运用,说明变量值集中的位置与离散程度。
2.变异指标种类虽多,但任一变异指标,其值大表示变异大,数值参差甚;值小表示变异小,数值较集中。比较两个或几个同类事物的变异,要用同一变异指标。
3.正态分布资料宜用均数与标准差(有时用方差)描述集中与离散情况,记为X±S。有了均数与标准差就可根据正态分布理论将频数分布描绘出来,进一步可作正常值范围估计与假设检验等(详见第五至第七章),应用较广。为便于计算,正态分布资料亦可用中位数、百分位数和四分位数间距等描述,其结果与用均数、标准差相近。
偏态分布资料宜用中位数及四分位数间距、均差等描述。尤其在资料分布呈明显偏态时,随着例数的增多,中位数、四分位数间距及均差的代表性和稳定性明显优于均数、标准差及方差。
众数和极差只用来对单峰资料作概括的描述。
4. 比较几组资料的变异程度,若各组资料的单位不全相同,或均数相差悬殊时,用变异系数。
5.判断几个方差或变异系数间有无显著差别,需作假设检验,不能只看表面值。详见第七、第八章有关内容。

5-3

练习题

1.
19.012.014.014.08.213.06.512.015.017.2
12.012.725.08.520.017.08.48.013.015.0
20.013.013.014.015.07.910.59.510.012.0
6.511.012.57.514.517.512.010.011.011.5
16.013.010.511.014.07.514.011.49.011.1
10.010.58.012.011.519.010.09.019.010.0
22.09.012.08.014.010.011.511.015.016.0
8.015.09.98.512.59.618.511.012.012.0
2.测得某地300名正常人尿汞值,其频数表如下。试计算均数、中位数、何者代表性较好。 300例正常人尿汞值(μg/l)频数表
尿汞值例 数尿汞值例 数尿汞值例 数
0-4924-1648-3
4-2728-952-
8-5832-956-2
12-5036-460-
16-4540-564-
20-2244-68-1
3.将表4.4资料分别用0.5cm、2cm为组距编制频数表,并与表4.3的频数分布进行比较,你认为何者显示变量值分布的特征较好? 4.有5个变量值7、9、10、14、15,试计算X及∑(X-x )。 5.下表为10例垂体催乳素微腺瘤经蝶手术前后的血催乳素浓度,试分别求术前、术后的均数,标准差及变异系数。应以何指标比较手术前后数据的变异情况?能说手术前数据的变异大吗?为什么? 手术前后患者血催乳素浓度(mg/ml)
例号血催乳素浓度例号血催乳素浓度
术 前术 后术 前术 后 
127641626643
2880110750025
3160028081700300
4324619500215
53981051022092
(资料来源:中华医学杂志,63(12)P730,1983 6.某地微丝蚴血症者42例治疗后7年用间接荧光抗体试验测得抗体滴度如下。求平均滴度。
抗体滴度的倒数10204080180
例 数5121375
(资料来源:中华预防医学杂志:17(1),P22,1983)