CHAPTER

第三章 描述性研究

《流行病学》

章节内容

5-1

一、相关性研究

(一)基本概念 相关性研究(correlationalstudy)又称生态学研究(ecological study)。它是以人群组为基本单位收集和分析资料,从而进行暴露与疾病关系的研究,即用代表人群组特征的量度来描述某些因素与疾病的关系,例如年龄、时间、卫生服务的利用,或者食品、药物及其他产品的消耗等。它描述某疾病或健康状态在各人群中所占的百分数或比数,以及有各项特征者在各人群中所占的百分数或比数。从这两类群体数据分析某疾病或健康状态的分布与人群特征分布的关系,从而探求病因线索。 (二)研究类型 1.生态比较研究(ecological comparison study)这种方法系比较在不同人群中疾病的发病率或死亡率的差别,了解这些人群中某些因素的出现率并同疾病的发病率或死亡率对比看是否一致,从而为探索病因找到线索。 例如,通过生态比较研究发现:①大肠癌在发达国家比发展中国家更常见。这促使人们考虑饮食习惯和环境污染是否与大肠癌发病有关。②大肠癌的发病率和死亡率的性别比接近1。这提示有关的暴露在男性和女性中应是相近的;并再次提示与饮食和环境暴露的联系。③大肠癌的发病率城市高于农村。这提示某些危险因素在城市比农村更为普遍,因此工业活动导致的环境污染应考虑可能为与大肠癌有关的因素。 2.生态趋势研究(ecological trend study)系指连续观察一个或多个人群中平均暴露水平的改变和某疾病的发病率、死亡率的变化的关系。世界卫生组织资助的心血管病趋热监测方案从1984~1993年,包括27个国家、39个中心、113个报告单位和1300万人口。其主要目的是测量心血管病发生和死亡的趋势,并将其与危险因素的变化,卫生保健和社会经济条件联系起来分析。这就是著名的MONICA方案。我国北京心肺血管中心1984年正式参加这个方案。北京市7个地区70万自然人群,通过三级心血管病监测网进行监测。就一个人群来讲,属于单组时间趋势研究;就整个MONICA方案来讲,则属于多组时间趋势研究。根据MONICA协作组和北京心肺血管中心已经报告的部分结果来看,心血管疾病的发生率和死亡率的变化与某些危险因素的变化,例如吸烟率、血压的平均水平、血清胆固醇水平等的变化有显著的相关关系。这不仅再次说明了吸烟、高血压和高胆固醇血症等为心血管病的危险因素;同时明确地提示心血管病是可以预防的,人们可以按计划采取行动,减少心血管病的发生和死亡。 (三)研究步骤 1.确定研究人群 根据具体情况,研究人群可大可小;可以是不同行政区或地理区域的全部人群,也可以是由其中不同年龄、性别、种族、职业、宗教和社会经济地位的人群所组成。确定研究人群时必须考虑到能否收集到有关研究人群疾病的发病率、死亡率及有关暴露的资料。 2.收集资料 以群体为单位收集资料。例如,若以全县为基本观察和分析单位,可以从各县的统计资料中得到有关人口学和社会经济方面的资料。如不同人群的年龄、性别构成,家庭平均收入,成年人受教育情况,人口密度,各民族人口所占的比例,城乡人口的比例,各种职业人口的比例,烟、酒的人均消费情况以及环境情况等资料;从卫生当局可以收集到不同年龄组各种疾病的发病率、死亡率、各种疫苗接种情况,动物传染源和媒介昆虫消长的资料。在作生态趋势研究时,还可以收集有关疾病时间趋势的资料。 3.分析资料 比较不同人群组的特征,进行生态比较研究,观察疾病与有关暴露之间的联系;亦可作生态趋势分析,观察不同人群组的特征的变化及疾病的变化之间的联系。 由于所分析的各人群人数可能有很大不同,因而各人群所提供的信息量也就不同,因此,在作相关和回归分析时,常需进行人数标化(加权分析)。 (四)主要用途 1.通过生态学研究可以提出与疾病的分布有关的病因假设。 2.可用于评价干预实验或现场实验的效果 例如,在某人群中推广低钠盐,然后比较推广低钠盐前后人群平均钠摄入水平的变化与人群平均血压值的变化趋势,以评价低钠盐干预的效果。 3.在疾病监测工作中应用生态趋势研究 以估计某疾病的趋势,有利于预防和控制疾病。 (五)生态学研究的局限性 生态学研究对于调查某些因素与疾病或健康状态之间的关系时,能够快速、经济地完成,并且常可利用现有的资料,如人口学的和各种产品的数据资料,疾病发生和死亡的资料,卫生资源利用情况的资料以及监测规划和疾病登记的资料等。 但是,生态学研究只是粗线条的描述性研究。生态学上某疾病与某因素分布的一致性,可能是该疾病与某因素间真正有联系,但也可能毫无联系。当生态学上的联系与事实并不相符时称为“生态学谬误”(ecologicalfallacy)或“生态偏倚”(ecological bias)。这就是生态学研究的局限性所造成的。主要有下列几种情况: 1.缺乏暴露与疾病联合分布的资料 这是指研究者只知道每个研究人群内的暴露数和非暴露数,患病数和非患病数,但不知道在暴露者中有多少发生了疾病或非暴露者中有多少发生了疾病。也就是说,生态学研究不能在特定的个体中将暴露与疾病联系起来。例如,有人研究了1950~1954和1965~1969年间宫颈癌死亡的减少与每年进行巴氏涂片筛检的妇女的百分比的相关情况。结果发现,筛检妇女百分比越高,宫颈癌死亡下降越大,二者之间有很强的统计学意义的正相关。因而认为,筛检规划可能导致宫颈癌死亡率减少。很显然,只根据该资料不可能决定经过筛检的妇女的死亡危险是否确实下降,因此不能检验该假设。 2.缺乏控制可能的混杂因素的能力 1964~1965年在28个国家里的一项研究表明,平均每人每天摄入猪肉量与乳腺癌死亡率之间有很强的正相关,提示猪肉摄入和乳腺癌死亡之间可能有联系。然而,增加猪肉消耗可能只是与乳腺癌危险增加有关的其他一些因素的一个标记,如增加了脂肪摄入,减少了蔬菜摄入或猪肉摄入多的人有较高的社会经济地位等。利用相关资料不可能将这些潜在的混杂因素的影响分离开。因而,相关的存在并不一定表明真实联系的存在。反过来,相关性研究缺乏相关,也并不一定表明缺乏真实的联系。例如,70年代的早期,美国口服避孕药(OC)的使用增加,而同时育龄妇女中冠心病(CHD)死亡率下降约30%。这些相关资料提示使用OC与致死性CHD间有负的联系。然而,大量分析性研究一致表明,使用OC者比不使用者平均致死性CHD危险增加约1倍。 3.相关资料中的暴露水平只是近似值或平均水平,而不是个体实验的值。因此,有时相关并不能精确地解释暴露的改变量与所致疾病发病率或死亡率的改变量的关系。有时还可能在疾病和暴露之间蒙上了更复杂的联系。例如,有人研究了19个国家酒精消耗与CHD死亡之间的相关。结果为明显的负相关,酒精消耗越多,CHD死亡越低。实际上,分析性研究表明,酒精消耗与CHD死亡之间不是一个简单的负的联系,而是一个“J”形曲线。重度饮酒者CHD死亡危险最大,中等量饮酒者致死性CHD的危险比重度饮酒者和不饮酒者均低。相关性研究很难看出这种非线性关系。 (六)研究实例 我国医务工作者应用相关性研究获得令人信服的结果者不乏其例。 例如,散发性脑炎,因各家对本病看法不一,故命名亦异,曾命名为“散发性病毒性脑炎”、“非特异性脑炎”、“不典型脑炎”、“急性播散性脑脊髓炎”、“弥漫性多灶性脑病”等。1978年全国第二届神经精神病学术会议后多称“散发性脑炎”。 1976~1988年温州医学院第一附属医院神经内科住院的379例“脑炎”病例的发生与温州市咪唑类驱虫药年销售之间有明显的联系。由表3-1和图3-1可见,1976~1982年四咪唑(TMS)的销售量越大,“脑炎”病例数越多。1976年TMS上市不久,年销售量15kg,当年病例数11例;次年销售量增至52.5kg,病例数增至40例;随后几年,两者几乎呈“并行”关系,为典型的正相关(r=0.994,P<0.01)。1982年下半年,卫生部发文淘汰包括TMS在内的127种药品,1983年病例数即由1982年的37例降为11例,1984年仅8例。病例数下降的时间比药品淘汰时间延迟的原因,作者推测可能与基层单位及民间江湖游医仍在应用TMS有关。1985年“脑炎”病例数有所回升,则可能与左旋咪唑(LMS)上市及大量应用有关。LMS与TMS的化学结构、药理作用相似,用法用量相同,基于上述分析得出结论,TMS在温州市的应用与淘汰是造成该市“脑炎”发病数骤升与骤降的直接原因。1983年和1984年“脑炎”病例数减少是TMS被淘汰带来的干预作用。LMS取代TMS上市,又使“脑炎”发病数回升。因此,咪唑类药物的应用与散发性脑炎的发病存在因果关系的可能性很大(药物流行病学杂志.郑荣远等.1993) 表3-1 温州市咪唑类驱虫药年销售量*及“脑炎”病例数(1976~1988年)
年 份
1976197719781979198019811982198319841985198619871988
TMS(kg)15.052.552.569.542.555.52.5000000
LMS(kg)0000002.540.587.5107.5107.5105.080.0
例 数1140385237503711817262329
*重量均按基质计算。郑荣远等,1993 liuxingbingxue022.jpg温州市咪唑类驱虫药年销售量与“脑炎”病例数的关系(1976.1~1988.12) 图3-1 温州市咪唑类驱虫药年销售量与“脑炎”病例数的关系(1976.1~1988.12)
5-2

二、个例调查和病例报告

个例调查(case investigation)又称个案调查或病家调查,是指对个别发生的病例、病例的家庭及周围环境进行的流行病学调查。病例一般为传染病病人,但也可以是非传染病病人或病因未明的病例等。
病例报告(case report)则是临床上详细地介绍某种罕见病的单个病例或少数病例。藉此,新出现的或不常见的疾病或疾病不常见的表现,能引起医学界的注意,从而可能形成某种新的假设。它是临床医学和流行病学的一个重要的联接点。
(一)个例调查
1.目的
(1)调查该患者发病的“来龙去脉”,从而采取紧急措施,防止或减少类似病例发生。如为单个传染病病例时,实际即对疫源地的调查。
(2)核实诊断并进行护理指导。
(3)掌握当地疫情,为疾病监测提供资料。
2.调查内容
除应调查一般的人口学数据外,还包括核实诊断,确定发病时间、地点、方式,追查传染源、传播因素或发病因素,确定疫源地的范围和接触者,从而指导医疗护理,隔离消毒、检疫接触者和采取宣传教育等措施。
3.特殊病例的调查
有些特殊病例,特别是原因不明的病例,有时虽然只是1~2例,亦需进行个例调查。例如1859年冬,德国医生Zenker诊治了一位“伤寒”病人,该患者20岁、女性,旅馆服务员,圣诞节发病,元旦即卧病不起,1月20日到医院就诊,一周后不治身死。尸检时Zenker在病人的肌肉里发现许多旋毛虫,他即到该女服务员的旅馆调查,发现该旅店老板娘几乎与该女青年同时发病。详细询问得知,1859年12月21日该店曾宰杀过一头猪。Zenker从剩下的猪肉取样检查,发现许多旋毛虫囊。进一步调查发现,旅馆老板和屠宰者后来也发生了同样的疾病。这样,Zenker从一个病例的调查开始,通过其流行病学实践,首先发现了人是怎样感染上旋毛虫的,为医学做出了贡献。
个例调查一般无对照,因而在病因研究方面作用不大。
个例调查往往还是爆发调查的一个组成部分,是流行病学工作者和防疫工作者的基本工作之一。
(二)病例报告
1.目的和用途
(1)病例报告往往是识别一种新的疾病或暴露的不良反应的第一个线索。许多疾病都是首先通过病例报告被发现的。例如孕妇服用反应停(thalidomide)引起新生儿先天畸形,口服避孕药增加静脉血栓栓塞的危险等。
对于病例报告的累积、监测常提示一种新的疾?
■[此处缺少一些内容]■
病例报告实际是我们监测罕见事件的唯一手段,常能激发人们去研究某种疾病或现象。
(2)有时可用于阐明疾病和治疗的机制。
例如,怀疑麻醉药氟烷能引起肝炎,但是由于暴露于氟烷后发生肝炎的频率很低,并且手术后肝炎还有许多其他的原因,因此“氟烷肝炎”难以确立。然而,如下的病例报告可以澄清这个问题。一名使用氟烷进行麻醉的麻醉师反复发作肝炎并已肝硬化,肝炎症状总是在他进行麻醉工作后几小时内发作。该病例暴露于小剂量氟烷时肝炎就复发,再加上有临床观察、生化检验和肝组织学等方面的证据,从而证明了氟烷可引起肝炎。
(3)介绍疾病不常见的表现。
2.缺点 由于病例数很少,而且有高度选择性,故易发生偏倚。病例报告不能用来检验是否真正存在着联系。它只是基于一个或少数几个人的经历。所发现的任何危险因素都有可能只是巧合。由于它固有的偏倚,以及不能估计所描述的事件的频率或机会的作用,不应该以病例报告作为改变临床诊断,治疗等的依据。

5-3

三、现况调查

现况调查(prevalencesurvey)又称现患调查或横断面调查(cross-sectional survey),是在一个确定的人群中,在某一时点或短时期内,同时评价暴露与疾病的状况,或在某特定时点(如参加工作前,入学或退休时)所做的体检等调查。现况调查是通过完成某特定时间该人群健康经历的一个“快照”,提供某病频率和特征的信息。 (一)目的和用途 1.查明当前某地区某种疾病的流行强度和该病在该地区的分布特点 以便分析患病频率与哪些环境因素、人群特征以及防病措施的质量等因素有关,有何关系。这些资料对公共卫生管理人员估价某人群健康状况和卫生保健的需求有很大价值。 2.现况调查的结果 可以提供某病的病因线索,供分析流行病学研究;还可用于提供某些职业中疾病的患病或其他健康结局的信息。现况调查适宜于对不会发生改变的暴露因素如血型、肤色、种族、性别等的研究;也适宜于对能发挥长期、慢性累积影响的暴露因素的研究,如高血压与冠心病的关系,糖尿病与动脉粥样硬化的关系等。对于这样一些因素,现况调查可以提供真实的暴露与疾病联系的证据。 3.早期发现病人 利用普查、筛检等手段,可以早期发现病人,利于早期治疗。例如高血压普查。 4.评价疾病的防治效果 如果定期地在某一人群中进行横断面研究,收集有关暴露与疾病的资料,该研究结果类似于前瞻性研究结果。将现况研究的结果与同一地区几年以前或几年以后的同类调查结果进行比较,则可评价某些疾病的防治效果。 (二)局限性 1.由于是在同一时点估价暴露和疾病状况,很多情况下难以判断孰前孰后、孰因孰果这是横断面研究作为病因研究的一个主要弱点。例如人们多次发现低社会阶层的人比高社会阶层的人精神紊乱患病率高。然而,到底是低社会阶层的人易发生精神疾患,还是患精神疾患的人易于落入低社会阶层呢,还值得研究。 同时,横断面研究的病人是“现存”病人,而不是新发病例,因此获得的资料不仅反映了病因学的因素,同时还有决定存活的因素。很快痊愈或死亡的病例包括在病例组的机会较少。如果病程短或很快致死的病例与病程长的病例的特征有所不同,则现况调查中观察到的联系不能代表实际的联系。例如,美国Evans县研究资料表明,黑人比白人冠心病(CHD)患病率低。由于这只反映了调查时人群的现况,它不意味着黑人中发生CHD低。因为如果黑人CHD的发生和死亡均高于白人,与某一时点上黑人患病率低并不矛盾,而横断面调查不能区分这种现象。 2.许多慢性病都有相对恶化和缓解期,现况研究可能把缓解期的病例错划为无病。此外,必须注意经过治疗或正在治疗的病例。这些病例在调查时可能没有疾病的表现,但是如果不治疗,则大部分可能归为病人。应当根据研究的目的对这部分人进行分类。一般在研究过程中,对这部分人应有所标明,以便分析中能适当地对待他们。 总之,现况调查对于病程短的病不能充分发现,对于急性非致死性或迅速致死的疾病都难以提供正确的分布情况。所以现况调查主要用于慢性病的研究。评价那些不会发生改变的暴露因素与疾病的联系,横断面研究并不亚于分析性研究。有时也可利用血清学检验、生化实验等进行感染率、带菌状况或免疫水平等的调查,以及生理、解剖、生化等指标的调查。 (三)研究设计要点 1.明确调查目的 是考核预防、治疗措施的效果,还是探索病因或危险因素;描述疾病的分布为社区诊断提供基线资料,为卫生保健工作决策提供参考,还是确定高危人群,等等。 2.掌握有关的背景资料 只有充分地掌握背景资料,了解该问题现有的知识水平,国内、外进展情况,才能阐明该研究的科学性、创新性和可行性,才能估价其社会效益和经济效益。掌握背景资料有三种途径:①自己经验的总结;②向有关专家请教;③查阅文献资料。这项工作不仅是制订计划时的工作,而且应当贯穿于研究的全过程,是一个十分重要的环节。 3.确定研究人群 调查者往往是在抽样后才测量暴露。这时可在一个确定的地理区域内的人口、家庭或其他单位抽取样本。有时根据暴露状态选择人群,特别是暴露容易识别时。例如,想比较天津市不同区的精神紊乱患病率,则可从不同区抽样。如果对某职业暴露有兴趣,可选择有暴露的工厂的工人与无暴露的工厂的工人,比较其患病率;或选择工厂中有暴露的部分工人与另一部分无暴露的工人比较。如果是相对小的人群,则可包括全部人群;如果不实际或花费太大,则可选择暴露组与非暴露组。 在横断面研究中,抽样过程使调查者有可能得到最有效的研究设计,以能代表将结果推及的目标人群为原则。 4.暴露的测量 暴露即我们所研究的因素,研究对象所具有的特征,所发生的事件。暴露并不仅限于与研究对象有关的外界因素,同时也包括机体内部的因素如遗传因素、内分泌因素和精神因素等。暴露又称变量。暴露必须有明确的定义和测量尺度。应尽量采用定量或半定量尺度和客观的指标。用调查表、记录、实验室检查、体检和其他手段来测量暴露。知道暴露于这些因素多长时间,什么时候暴露很重要。例如调查者常想知道是否吸烟时间越长,疾病患病率越高。 5.疾病发生的测量 在人群中进行现况调查时,应尽量采用简单、易行的技术和灵敏度高的方法。同时需注意检验结果中的假阳性,特别在患病率较低的疾病的现况研究中尤为重要。例如,某项方法检出肺癌,其假阳性率为1%。假定调查人群肺癌患病率为5/10万,也即调查10万人有5名病人,而同时在其余99995名中检出假阳性病人999.95人,即1000人。这时,如不能鉴别5例病人和1000名假阳性病人,就会误认为患病率为1000/10万或1%。由此可见,在人群中通过现况调查研究发现病人与在医院中诊断一例病人是性质不同的两件事。 对疾病必须提前建立严格的诊断标准,标准要利于不同地区的比较。调查表、体检或一些特殊检查常联合应用。如果可能,应测定疾病首次症状发作的时间。有时由于疾病系逐渐发生难于确定发作时点,或直到现况调查时才知道疾病存在。 对有恶化期或缓解期的疾病,重要的是询问没有症状或体征的人过去是否曾有过症状。虽然调查者或许不能据此肯定他们是否有病,但可以考虑他们可能有病或分析时将他们分开分析。 6.拟定调查表 调查表又称问卷(questionnaise),是流行病学调查的主要工具。调查表设计的好坏,对调查结果有着举足轻重的影响。调查表没有固定的格式,内容的繁简、提问和回答的方式应服从于调查的目的,并适应于整理和分析资料的要求。现在普遍采用的格式是把拟收集的数据项目用恰当的措词构成一系列的问题。 调查表的主要内容分为两类。一是一般性项目或叫识别项目,包括姓名、性别、年龄、出生年月、出生地、文化程度、民族、职业、工作单位、现住址等。另一部分即调查研究项目或叫研究变量。这是调查研究的实质部分。编写这部分内容时应注意以下几项原则: (1)措词要准确、简练、通俗易懂、易于回答,尽可能不用专业术语,避免引起被调查者的误解或不同理解。 (2)与本次调查有关的项目一项也不能缺,而与本次调查无关的项目一项也不应有。 (3)问题按逻辑顺序和心理反应排列,先易后难,先一般后隐私。不能遗漏可能的答案。例如询问“你爱吃酸还是爱吃辣”,如果供选择的答案只有“爱吃酸”和“爱吃辣”两项,则漏了“酸辣都爱吃”“和酸辣都不爱吃”两种答案。正确的设计应列出全部四种答案。 (4)尽量获取客观和定量的指标。例如询问“你吃水果是经常吃、不常吃还是偶尔吃”,不如问“你每月吃多少水果?21斤以上,11~20斤,10斤及以下”更好些。 调查表中提问的方式主要分“封闭式”和“开放式”两种。“封闭式”即在问题后列出若干互斥的备选答案,供被调查者选定其中的一个。答案的范围相当于测量的尺度。“开放式”指年龄、出生日期、吸烟支数等一些不能明确限定答案尺度的问题。有时也可将两种方式结合起来提问。 准备用计算机处理的调查表,常在每项数据后留出编码用方框以便于编码输机。 一般说,一个完善的调查表并不是一次就可以拟就的。如有可能,最好做几次包括设计人员参加的预调查,须几经试用和修改方可臻完善。 7.对调查员的要求 对调查员的最基本要求是实事求是的科学工作态度和高度的责任心。调查员要有一定的文化水平,但是并非医学水平越高的人越适于做调查工作。相反,有医学知识的人易于掺入自己的假设和看法,调查时易于诱导性地提问题而产生信息上的偏倚。从这个意义上讲,倒不如非医务人员调查更客观。对调查员应经过严格的培训和考核再决定取舍。 (四)普查、筛检及抽样调查 1.普查和筛检 现况调查若是为了早期诊断、治疗病人,在特定时间、特定范围内进行全面调查称为普查(censns)。特定时间应当较短,甚至指某时点。特定范围指某个地区或具有某种特征的人群。 普查的目的除了早期发现和治疗病人之外(如各地开展宫颈癌的普查),有时还是为了了解疾病和健康状况的分布而进行的。前者如了解血吸虫病、高血压病、冠心病等的分布;后者如对儿童发育、营养的调查等。 普查不适用于发病率很低或无简易诊断手段的疾病。因是横断面调查,故一般只能获得阳性率或现患率而得不到发病率资料。同时,还应注意普查的成本和收益问题。如过去用拍胸部小于X线片来普查肺结核,成本高、收益少,现已不再使用。 筛检(screening)的目的主要是为了早期发现可疑患者,以便能进一步确诊,达到早期治疗的目的。筛检实际可看做普查过程中一个较早的组成部分。其方法及评价见第五章。 2.抽样调查 如果现况调查的目的是为了查明现患情况或当前某病的流行强度,则可用抽样办法进行调查,即抽样调查。例如我们要研究某个地区某病现患率,该目标地区的总体人群即目标人群(target population)或叫抽样框架(sampling frame),按统计学原则从其中抽取部分人作为调查对象,即样本人群或研究人群(study population)。然后,可根据样本人群的结果推断目标人群的现患率。 抽样调查比普查费用少、速度快、覆盖面大、正确性高。 抽样调查的缺点是不适用于患病率低的疾病,不适用于个体间变异过大的资料,并且设计、实施和资料的分析均较复杂。 抽样必须随机化,样本必须足够大,这两点是抽样调查的基本原则。 (1)抽样方法:目前在流行病学调查中使用的抽样方法有单纯随机抽样、系统抽样、分层抽样、整群抽样和多级抽样。在现况调查中,后三种方法较常用。 1)单纯随机抽样(simple random sampling):这种方法的基本原则是每个抽样单元被抽中选入样本的机会是相等的。简便、易行的科学分组方法是利用随机数字表。抽签、抓阄的方法严格地说不能达到完全随机化,但因其简单、实用,小范围的抽样仍可使用。简单随机抽样首先要有一份所有研究对象排列成序的编号名单,再用随机的方法选出进入样本的号码,已经入选的号码一般不能再次列入,直至达到预定的样本含量为止。 单纯随机抽样的优点是简便易行。其缺点是在抽样范围较大时,工作量太大难以采用;以及抽样比例较小而样本含量较小时,所得样本代表性差。 2)系统抽样(systematic sampling):此法是按照一定顺序,机械地每隔一定数量的单位抽取一个单位进入样本。每次抽样的起点必须是随机的,这样系统抽样才是一种随机抽样的方法。例如,拟选一个5%的样本(即抽样比为1/20),可先从1~20间随机选一个数,设为14,这就是选出的起点,再加上20,得34,34加20得54,……。这样,14,34,54,74,94就是第一个100号中入选的数字,以后依次类推。 系统抽样代表性较好,但必须事先对总体的结构有所了解才能恰当地应用。 3)分层抽样(stratified sampling):这是从分布不均匀的研究人群中抽取有代表性样本的方法。先按照某些人口学特征或某些标志(如年龄、性别、住址、职业、教育程度、民族等)将研究人群分为若干组(统计学上称为层),然后从每层抽取一个随机样本。分层抽样又分为两类:一类叫按比例分配分层随机抽样,即各层内抽样比例相同;另一类叫最优分配分层随机抽样,即各层抽样比例不同,内部变异小的层抽样比例小,内部变异大的层抽样比例大,此时获得的样本均数或样本率的方差最小。 分层抽样要求层内变异越小越好,层间变异越大越好,因而可以提高每层的精确度,而且便于层间进行比较。 4)整群抽样(cluster sampling):抽样单位不是个体而是群体,如居民区、班级、连队、乡、村、县、工厂、学校等。然后用以上几种方法从相同类型的群体中随机抽样。抽到的样本包括若干个群体,对群体内所有个体均给以调查。群内个体数可以相等,也可以不等。 这种方法的优点是,在实际工作中易为群众所接受,抽样和调查均比较方便,还可节约人力、物力和时间,因而适于大规模调查。但整群抽样要求群间的变异越小越好,否则抽样误差较大,不能提供总体的可靠信息。 5)两级或多级抽样(two-stage or multi-stage sampling):这是大型调查时常用的一种抽样方法。从总体中先抽取范围较大的单元,称为一级抽样单元(例如县、市),再从抽中的一级单元中抽取范围较小的二级单元(如区、街),这就是两级抽样。还可依次再抽取范围更小的单元,即为多级抽样。 多级抽样常与上述各种基本抽样方法结合使用。 (2)样本含量 1)对均数做抽样调查时的样本含量公式: n=(uaσ/δ)2(式3-1) 式中n为样本含量,uα为正态分布中自左至右的累积概率为σ/2时的u值(如u0.05=1.960,u0.01=2.576),σ是标准差,δ是允许误差。也可用如下公式: n= (tas/δ)2(式3-2) 式中s为样本标准差代替总体标准差σ,以t分布中的tα代替正态分布中的uα。当样本含量n<30时,用后一个公式更合适。 例:欲调查某病病人血红蛋白含量,据以往的经验,σ=3.0g/100ml,要求误差不超过0.5g/100ml,并定α=0.05,则该调查样本大小为: n=(tas/δ)2=1.960×3.0/0.5)2≈139(人) 2)对率做抽样调查时的样本含量公式: N=K×Q/P(式3-3) N为调查例数,P为预期阳性率,Q=1-P。当容许误差为10%时,k=400;容许误差为15%时,k=178;容许误差为20%时,k=100。(见表3-2)。 表3-2 按不同预期阳性率和容许误差时现况调查样本大小
预期阳性率容 许 误 差
0.1P0.15P0.2P
0.05760033821900
0.075493321931328
0.1036001602900
0.1522641000566
0.201600712400
0.251200533300
0.30930415233
0.35743330186
表3-2是用上式计算出来的样本大小,可参考使用。但须注意,当流行率或阳性率明显小于1%时,此式不适用。
5-4

四、爆发与流行的调查

爆发调查是指对某特定人群短时间内发生多例同一种疾病所进行的调查。爆发有传染病的爆发。传染病的爆发有集中、同时的爆发,也有连续、蔓延的爆发。前者如呼吸道传染病、食物中毒的爆发;后者如痢疾、伤寒、甲型病毒性肝炎的爆发等。爆发也有非传染病的。如“麻痹症”爆发,“抽搐症”爆发,出血性疾患爆发,急性皮炎爆发等,表现形式多种多样。对非传染病爆发调查的思路、方法及步骤与对传染病的大同小异。
(一)爆发类型、流行曲线及暴露时间
1.爆发类型 爆发可根据暴露于病原体的性质和时间长短,蔓延和传播的方式以及爆发和流行的间期而分类。
(1)同源爆发(common source outbreak):指某易感人群中的成员同时暴露于某共同的病原体或污染源而引起的爆发。例如,一次会餐引起的食物中毒爆发。但是也可能是由于某媒介物受到污染,例如包装的食品、罐装的饮料或药物等。此时由于暴露(即消费)的地点和时间可能有所不同,因而在不同地点和时间引起爆发。
(2)连续传播性流行(propagated epidemic):致病性病原体从一个受感者转到另一个受感者。转移可通过直接接触或经中介的人、动物、节肢动物或媒介物而实现;还可以通过行为传播,如静脉内使用毒品者和同性恋者中的乙型肝炎和艾滋病的传播。
(3)混合型(mixed epidemic):以上两型结合。通常是先发生一次同源爆发,而后通过人与人的传播继续流行。例如经食物传播的伤寒、甲型肝炎等。
2.爆发终止 具有下列条件之一项或多项时,爆发或流行通常终止。
(1)污染源或致病源消除或改变。
(2)传递环节中断或消除。
(3)暴露者或易感者明显减少或已没有。这种情况可通过离开传染源、发生该疾病、主动或被动免疫、预防用药等而发生。
3.流行曲线(epidemic curves)以横坐标为时间尺度,纵坐标为病例数,把各单位时间内(小时、日、周、月或年)发生的病例数标记在相应的位置上,可构成直方图或线图,称流行曲线。流行曲线因病原体、传递方式、每传递一代的时间、暴露的类型和时间长短的不同而异,同时还取决于潜伏期长短和暴露的易感者人数。图3-2为几种典型的流行曲线图。图中I表示一次简单的同源暴露引起的爆发,如某次会餐后的食物中毒爆发,所有病例都集中在A-B这段时间内,这段时间即为有关疾病的常见潜伏期范围。
liuxingbingxue023.jpg几种典型的流行曲线图
图3-2 几种典型的流行曲线图
有一类传染病例如伤寒,同源暴露感染的病例通常可通过人与人之间的传播蔓延,因此可有一定数量的二代病例出现,因而流行曲线可持续一段时间(图Ⅱ中B-C)。
图中Ⅲ的流行持续时间更长,并且终止时的疾病发生率与流行发生前的水平相似或更高。如系同源暴露,可能因人与人间的传播未能得到控制,或者同源暴露持续了较长一段时间,如某水井被附近厕所不断污染造成持续性同源爆发。
图中Ⅳ表示一次非同源暴露,其病例出现缓慢,逐渐积累增多,在爆发过程的早期,有时可能看到波浪形的曲线,“波”代表连续传播的“代”,两个波峰之间的间隔为平均潜伏期。肠道疾病、呼吸道疾病及人作为宿主的虫媒传播疾病中可见到这种流行曲线。
还有一种传播形式,即通过行为或文化教养特点的传播。如图3-3示英格兰58名年轻人滥用海洛因者的传播。
liuxingbingxue024.gif英格兰Crawley58名年轻人嗜用海洛因成瘾的连续传播流行曲线
图3-3 英格兰Crawley58名年轻人嗜用海洛因成瘾的连续传播流行曲线(Abarcon.1969)
转引自 Barker.1990
4.暴露时间的推算 暴露时间的确定关系到调查范围和可疑病原的追查,所以是至关重要的。根据潜伏期可以推算暴露时间。如果病原已知,同源性爆发的暴露时间推算方法有两种:一是从位于中位数的病例的发病日期(或流行曲线的高峰处)向前推一个平均潜伏期,即为同源暴露的近似日期。图3-4示一次同源暴露的伤寒流行曲线。83例病例的第42例为中位病例,于3月29日发病,向前推一个平均潜伏期14天,3月15日便是共同暴露的近似日期。另一种方法是从第一例发病日期向前推一最短潜伏期7天,再从最后一个病例发病日期向前推一个最长潜伏期21天,这两个时点之间,即3月14日至17日之间的某个时间可能是同源暴露的时间。
liuxingbingxue025.gif在一次伤寒同源爆发中估计可能的暴露日期
图3-4 在一次伤寒同源爆发中估计可能的暴露日期
(二)调查方法
1.确定问题,核实诊断 确定流行或爆发是否存在是首当其冲的问题。为此目的,早期发现致病源是最重要的一步。这不仅是为了识别爆发或流行的疾病,而且还可能明确传播机制和控制手段。为了诊断病例,首先要有疾病的工作定义(working definition),以便识别和报告病例。当对传播的来源、方式或病原体了解更多以后,有时有必要修改病例的诊断标准。
2.评价现有的资料,全面考察疫情,计算各种罹患率 应尽可能地早确定爆发疾病的流行病学特征,包括不同人群、时间和地点的发病资料、临床特点及环境的评价。具体步骤如下:
(1)确定爆发的范围。
(2)如果可能,通过适当的实验室检查确定病因学诊断。
(3)识别所有的处于危险的人。
(4)识别主要的临床和流行病学特征,包括发病的年龄、性别、种族情况,发生的日期,以及有关的血液学指标。
(5)获得水、食物、空气等可能与病原传播来源有关的环境中样本的基础资料。
(6)获取有暴露危险的人的名单、食堂苹果、家庭或旅馆的位置等资料。
(7)组织调查队伍,包括流行病学家、临床医师、实验室工作者和其他卫生人员。
(8)与当地行政部门联系以取得支持。
3.可能的传播方式 当暴露于一个共同来源(如空气、水、牛奶、某种食品、受感染的人、动物、寄生虫等)的某些人比其他罹患率高得多时,或能找到有关的致病源时,则传播方式可能查明。
4.注意特殊情况 爆发的调查主要是寻找与该病最高发病率有关的暴露。与此同时,调查者应特别注意,为什么某些人有暴露却未发病,而某些人无暴露却发病了。这些情况常可提供关于爆发来源及传播方式的线索。例如,1994年夏季在北戴河开会的天津某学术团体发生了食物中毒。一名临时到会的干部吃了某晚餐后出现了同样的症状,而该团体中吃了某晚餐但未吃扒海参这道菜者均未发病。这些证据强烈地提示该晚餐的扒海参是疾病的来源。
5.形成假设并检验假设 流行病学工作者将可利用的资料集合起来后,对爆发的来源和传播方式提出假设,就像临床医生检查病人后做出临床诊断一样。然后,对假设是否正确进行检验,包括进一步分析,实验室检查,或者针对可疑来源或可疑传播方式的某种控制措施的效果评价。应当能证明:①所有病例、实验室资料和流行病学证据与初步假设是一致的。②没有其他假设与该资料相符。③暴露程度越大(或假设的致病原的剂量越高)疾病的发生率越高。
6.爆发调查中应边调查、边分析、边采取控制爆发与流行的综合措施,以免延误时机。
7.总结报告 包括爆发的经过,调查过程与主要表现,采取的措施与效果,经验教训与结论等。尽量用数字、表格、统计图来说明。报告既可供行政当局决策时参考,还可能有医疗和法律上的用途。
由以上所述,可见爆发调查中大量的工作属于描述性研究。但是在进一步调查分析中,常需对可疑的爆发原因进行假设检验,这必须通过病例对照研究和队列研究技术来完成。将患病的与未患病的两组暴露于某可疑致病因子的比例进行比较,看是否有显著差异;或者比较有暴露史与无暴露史的两组罹患率有无统计学上有意义的差别。从而使判断爆发的原因更可靠更有说服力。近些年来,爆发调查时,病例对照的研究方法应用越来越普遍。因此,爆发调查中既有描述性研究,又常包含分析性流行病学研究。