CHAPTER

第五章 诊断试验及疾病筛检的评价

《流行病学》

章节内容

7-1

一、筛检

(一)筛检的概念
筛检(screening)是在大量人群中通过快速的试验和其他方法,去发现那些未被识别的病人、可疑病人或有缺陷的人。
liuxingbingxue041.gif筛检步骤示意图
图5-1 筛检步骤示意图
筛检不是诊断试验,它是把健康人和病人(疑似病人、有缺陷的人)区别开来的方法,它仅是初步检查,是早期发现病人的一种方法。对筛检试验阳性还应进一步确诊。
对某种疾病来说,在一般人群中包括三种人,一种是无该病的健康人,一种是可疑有该病但实际无该病的人,一种是有该病的人。这三种人混杂存在。筛检的工作即是将健康人与其他两类人区别开来。然后用更完善的诊断方法,将可疑患该病但实际无该病的人与实际患该病的人区别开来,(见图5-1)。第三步为对有该病的人进行治疗,使之恢复。因此,筛检是第一步,诊断试验是第二步,治疗是第三步。
(二)筛检的分类
1.人群筛检(population screening,massscreening)是指用一定筛检方法对一个人群进行筛检,找出其中患该病可能性较大的人,然后,对其进一步诊断及治疗。如先用尿糖测定筛检出可疑糖尿病病人,再用其他方法(如血糖测定)以确诊,然后加以治疗。
2.多次(级)筛检(multiple screening)在上类筛检中,同时应用多种筛检方法进行筛检,可以同时筛检多种疾病。
3.定期健康检查(periodical health examination)或目标筛检(targeted screenig)对有某种暴露的人群(如铅作业工人)、高危人群、某一单位、某种职业人群定期进行健康检查,以早期发现病人,及时给予治疗。
4.病例搜索(case-finding)或机会性筛检(opportunisticscreening)筛检的对象局限于因其他原因而找临床医师或卫生医师诊治或咨询的人。即是临床医师或卫生医师对来诊者加用其他筛检方法,以发现与主诉无关的疾病。
(三)适用于筛检的疾病、对象及筛检应用的原则
在开展筛检规划时应当注意以下几点:
1.应当筛检危害严重的疾病或缺陷,迟发现将造成严重后果 如遗传性代谢缺陷的苯丙酮尿症(phenyl ketonuria)及某些癌症(如宫颈癌),或某些已成为重大的社会卫生问题的疾病或缺陷。
这些疾病的自然史应当已经清楚,以便能准确判断筛检措施的效果。
这些疾病应当是临床前期现患率高的疾病,并且从出现首发体征到出现明显疾病间有较长的间隔。
这些疾病应该有可以识别的早期症状和(或)体征,有进一步确诊的条件和治疗方法及统一的治疗方案和标准。
2.筛检试验的特点 筛检试验必须具有快速、简单、易进行、价廉、安全、可靠、灵敏、特异、有效、能被受试者接受。还应考虑筛检、诊断和治疗等的经济消耗和收益问题。
所谓经济消耗和效益是指筛检规划所需的经费和该规划所能筛检出的病人数以及不筛检的不良后果。通常说,在筛检的人群中该病临床前期病人的患病率应该是高的,偶尔的领先时间(先导时间,lead time)。领先时间指的是从筛检发现到该病人因症状而去就诊的时间间隔。领先时间长的疾病,在筛检发现后,有时间加以诊断、治疗。其结果优于症状明显后自动去就医的。高血压及噪声性耳聋有较长的领先时间,而胰腺癌仅有一个短的领先时间。领先时间短的疾病进展很快,从筛检发现到因症状而去就诊仅有短短的时间。筛检发现后开始治疗比其自动就医后开始治疗,好处不大。
对筛检的疾病,应该有进一步确诊的方法及有效的治疗措施。早期治疗应当比晚期治疗可以降低筛检的疾病的死亡率或患病率,如原位性子宫颈癌、早期乳腺癌。这类疾病治疗方法还应该能被尚无症状的病人所接受,而且是安全的。对尚无有效治疗的疾病,进行大规模筛检(如全民检查HBSAg)只会使阳性者长期担惊,使周围人害怕。参加者更长时间知道自己有这种病,在做其他研究时,由于这种情况而引起的偏倚,叫作长期偏倚(length bias)或长期/时间偏倚(length/time bias)。
3.对特殊暴露人群进行筛检 其标准可比在一般人群开展稍松些。比如轻度不适(如恶心、头痛)。如果减少劳动能力或健康感,虽然轻微也应考虑筛检,以减少疾病。有时暴露有不同等级,轻度暴露时加以筛检,也许可以预防严重后果。这类筛检通常在工作场所进行。有些国家对某些职业人群规定定期筛检,如对矿工进行矽肺(尘肺)筛检,对石棉工进行石棉肺、肺癌的筛检,对接触铅作业职工及其他严重有毒、有害环境作业职工的定期筛检。
4.筛检试验的条件 筛检试验应该价廉,易于执行,能被群众接受,具有可靠性及真实性。可靠性(reliability)是指该试验应该永远得出一致的结果。真实性(validity)用灵敏度(sensitivity)和特异度(specificity)表示,是指将被筛检的对象正确地归类到有病或无病组。
灵敏度指的在该人群中的病人被此筛检试验正确地判断为有病的百分数。特异度即在该人群中的非病人被此筛检试验正确地判断为非病人的百分数。其计算方法见诊断试验节。
人们当然希望一个筛检试验既有高的灵敏度,又有高的特异度。可是,实际情况是,当变动诊断标准提高该筛检方法的灵敏度,必然降低其特异度,将诊断标准向另一方向移动,提高其特异度,则必然降低其灵敏度。
究竟将筛检试验的诊断标准定在何处为宜,则既要考虑到漏诊或误诊对该病的重要性,又要考虑对大量的假阳性(或假阴性)病例进一步确诊、治疗等的经费、人力、物力的消耗以及对病人的健康(漏诊)或精神负担(误诊)的影响,全面衡量最后加以确定。对于新生儿严重疾病的筛检,希望有高的灵敏度,而容许假阳性加多(降低特异度)所增加的经济负担。因为需要进一步随访以确定其为真阳性或真阴性。
5.确定筛检标准时应考虑的问题 既要考虑该病的自然史,又要考虑其治疗的收益和消耗。对新发现的病例还应该有合适的进一步确诊、治疗、随访的设备。最后,这种筛检规划还应该能为所有有关人员(如行政管理人员、卫生工作者及被检群众)可以接受。
(四)筛检效果的评价
1.新发现的病例(或有缺陷人)数 一项筛检试验应当能从人群中发现一些过去未识别的病人(或有缺陷的人),发现率愈高说明这项筛检效果愈好。此时还应考虑此种疾病(或缺陷)的患病率高低,距上次同样筛检时间间隔长短等影响因素。
2.对疾病结局的影响 一项筛检试验应当能导致改善疾病预后,降低发病率,死亡率、合并症发生率,提高生存率。改善愈大,效果愈好。理想的方法是比较由筛检发现的病人及因症状而来就医的两组人。但因为参加与未参加筛检的两组人可能存在的差别,所以评价筛检效果最好用随机对照试验。在纽约用随机对照试验观察了约6万名40~64岁的投保险的妇女达23年,比较经过筛检(乳腺摄影,mammography)的妇女与未经筛检的妇女,随访5年时,经筛检组乳腺癌死亡率比未经筛检组低38.1%,10年时低28.6%,18年时低22.7%(Shapiro,1989)。
3.成本效益分析(cost-benefit analysis,CBA)进行一项筛检试验是很费人力、物力、财力的。所以筛检的效果应当从成本效益方面进行分析。筛检试验的成本指的是筛检试验所花费的全部费用,而效益则为通过筛检所取得的经济效益(经过筛检早期发现病人,节省的医疗费用等能用货币计算的效益)及社会效益(指的是提高生活质量和卫生服务质量等,给社会、社会活动、人群的精神和健康所带来的好处),在患病率很低的情况尤应进行此种分析。如丝虫病患病率高时,对人群末梢血筛检,一次可以发现大量微丝蚴血症者,加以治疗,效果相当可观。而在一地区多次筛检、普治后,微丝蚴血症率已很低,微丝蚴数目也极低时,再用引法筛检,发现1例阳性要比患病率高时多用若干倍成本。此时应当重新考虑用什么方法筛检。筛检血片以查疟疾病人及疟原虫携带者,也有类似情况。
(五)筛检中的偏倚
筛检试验既是一种试验,它同样可以有选择性偏倚、衡量偏倚、混杂偏倚。这些偏倚在第七章偏倚节加以叙述,可以参阅。
在筛检试验中可能出现的特殊偏倚如下:
1.领先时间偏倚(lead time bias)由于筛检试验提前发现了那些尚未发展到明显疾病而来主动就医的病人,如果忽略这一点,在比较筛检查出的病人及来医院就诊病人的存活期、病死率、治愈率等等,就可能因为领先时间偏倚而使结果偏离真实情况。
2.病程长短引起的偏倚 病程短的疾病被筛检出的可能性低于病程长的病。在评价筛检时应考虑病程长短可能带来的偏倚。

7-2

二、诊断试验

诊断试验不同于筛检试验处是,筛检试验把病人及可疑病人与无病者区别开来。诊断试验则是进一步把病人与可疑有病但实际无病的人区别开来, (一)诊断方法 1.诊断指标 可以分为三类。 (1)主观指标:指由被诊断者的主诉而确定的,如不舒服、头晕、头痛、食欲不振、失眠等等。这些指标最容易受被诊断者的主观影响而改变。如病人信任某医生给他服用了好的安眠药(可能根本不是安眠药),他可能就认为自己睡得好(实际上也许和往常一样)。因此,仅凭被诊断者主观感觉的指标,作为诊断指标常常很难反映真实情况。 (2)半客观(或半主观)指标:指根据诊断者的感觉而加以判断的指标,如肿物的硬度,肺部啰音的多少,脉象弦、滑等等。因为由诊断者主观判断,不同诊断者常易出现不同的判断。应用时,必须严格规定标准。 (3)客观指标:能用客观仪器加以测量的。很少依赖诊断者及被诊断者的主观意识判断,所以是比较最可靠的。在这类指标中,被观察者死亡的结果是一个绝对客观的指标,是不易弄错的。用仪器测定的结果,如体温计测的体温,胸部X线片观察肺部及胸骨病变,用血压计测定血压等等。这些都是客观记录下来的,但其结果是由观察者去判断的,虽然各观察者之间的差别不应该太大,但也存在不一致的机会。因此在应用一般客观指标时,也应该严格规定其详细的标准,以便得到可靠的结果。用自动记录仪器,也可得到可靠的读数。 2.诊断标准 诊标指标确定之后,就应该确定一个诊断标准(诊断界限)用以区别正确与异常。由于调查或筛检的结果经常以发病率、患病率、死亡率来表示,而这些率的分子是病人或因某病而死的人数。如果诊断不正确或诊断标准不一致,则所得出的率就不一样。 设以高血压患病率调查为例。以血压计上的kPa(1kPa=7.5mmHg)作为高血压的诊断指标。对高血压必须规定一个诊断标准。通常采用WHO规定的标准,即收缩压(SBP)为≥21.3kPa及(或)舒张压(DBP)≥12.7kPa为诊断高血压的标准。如果不同地区或不同时期采取的标准不一,则其结果不能相同。即或在同一地区、同一时间采取不同标准,也会得不同的结果。按一个地区血压值的分布如图5-2。如果以舒张压≥12.0kPa诊断为高血压,则高血压患病率为25.3%,如以≥12.7kPa作为高血压,则高血压患病率为14.5%,如以≥14.0kPa为标准,则患病率为4.8%。可见诊断标准必须统一与固定,才能得到准确的患病率。 在测定眼内压以诊断青光眼,测定血清转氨酶的单位数以判断是否正常,以血清效价来判定正常,以皮肤反应的红晕、荨麻疹直径大小判定阳性等等,都有一个正确的诊断标准问题。 通常遇到的情况是正常人的数值与病人的数值有重叠情况,如有人收缩压在20.0kPa还可被认为是正常值,而有的人则已属高血压;肥达反应H凝集效价有一些病人为1:80,而有一些健康人也可以有这种凝集效价。这种重叠的情况如图5-3所示。A为病人的最低值,B为非病人的最高值,在AB之间则既有病人,又有非病人。如果把病人与非病人的分界订在A,固然不会漏掉病人,但将会把一部分非病人划为病人组中;如果将分界订在B,虽没有将非病人误算为病人的情况,但又可以漏掉相当一部分病人;将分界订在AB之间的某个数值,则既有一小部分病人被算作非病人(漏诊),又有一小部分非病人被算作病人(误诊)。 liuxingbingxue042.gif30~60岁158906人舒张压分布 图5-2 30~60岁158906人舒张压分布 liuxingbingxue043.gif病人与非病人不同数值的分布示意图 图5-3 病人与非病人不同数值的分布示意图 在选定标准时,应该考虑到假阴性(漏诊,将病人作为非病人)或假阳性(误诊,将非病人作为病人)时,鉴别诊断试验的繁简程度;漏掉一个可能的病例其后果如何,有没有什么严重性;一定间隔期后再一次检查的可能性:以及该病的患病率等因素,以拟定一个合适的标准。在流行病学调查时应严格按规定标准进行诊断,不允许随意更改。这样就应该允许有一定程度的假阳性错误(第一类错误,α)或一定程度的假阴性错误(第二类错误,β)。 3.误诊率、漏诊率按图5-3,设将病例诊断标准定于AB之间,则在该分界左侧的小部分病人将被诊断为非病人(假阴性,漏诊),而在该分界右侧的小部分非病人将被诊断为病人(假阳性,误诊)。诊断标准确定后,在人群中进行诊断时,可能出现如表5-1的情况。 表5-1 按所定诊断标准将人群分组
按所定诊断按“金标准”诊断
标准有病无病
阳 性α(真阳性)b(假阳性)
阴 性c(假阴性)d(真阳性)
灵敏度 ,(式5-1),即实际有病而按该诊断标准被正确地判为有病的百分率(真阳性率)。 特异度 ,(式5-2),即实际无病按该诊断标准被正确地判为无病的百分率(真阴性率)。 灵敏度、特异度高表示该项诊断试验对于有病、无病的识别能力强。 假阴性率(漏诊率、第二类错误,,(式5-3),即实际有病,但根据该诊断标准被定为非病者的百分率。 假阳性率(误诊率、第一类错误,,(式5-4),即实际无病,但根据该诊断标准被定为有病的百分率。 一项诊率效率高的诊断方法应该是真阳性率高,假阳性率低。这二项之比称为该诊断的似然比(likelihood ratio,LR),似然比愈大,诊断的价值也愈大。 (式5-5) 计算灵敏度、特异度应该用规范的诊断方法。此诊断方法是目前临床应用的灵敏度和特异度都最高的方法(或标准),又叫“金标准”(gold standard)。比如用冠状动脉造影诊断冠心病,用活检诊断结核、肿瘤,用手术诊断胆石症等。一个诊断方法如果不与金标准比较,则所得真、假阳性、真、假阴性不能反映真实的灵敏度、特异度。 一个诊断试验判定的结果与规范的标准诊断的结果相比时,二者相同的百分率叫符合率。符合率还可用于比较两个医生诊断同一组病人,或同一医生两次诊断同一组病人的结果。 (式5-6)(式5-7)(式5-8) 一个诊断方法的正确诊断指数(r,Youden’s index)可用于比较两个诊断方法,它表示诊断方法的真实度。 r=1-(假阳性率+假阴性率)=(灵敏度+特异度)-1  (式5-9) 设以高血压为例,检查10000人,如以收缩压21.3kPa为诊断标准,阳性(≥21.3kPa)病人25人,阴性(<21.3kPa)病人25人,阳性非病人995人,阴性非病人8955人。可计算如下: liuxingbingxue050.gif 正确诊断指数=(0.50+0.90)-1=0.40 如以收缩压17.3kPa为标准,阳性(≥17.3kPa)病人40人,阴性(<17.3kPa)病人10人,阳性非病人1990人,阴性非病人7960人。 liuxingbingxue051.gif 正确诊断指数=(0.80+0.80)-1=0.60 4.诊断方法的评价 (1)可靠性:用同一种诊断方法在同样条件下,对相同的人群进行一次以上的检查,结果愈恒定(试验结果稳定性高),此诊断方法的可靠性愈高。 影响一种诊断方法的可靠性的因素有三: 1)方法的差异:如试剂的稳定性及被测物质数值的波动(如被测物的昼夜差异)。试验方法可受试剂质量、配制方法、温湿度等因素影响。仪器也可受外环境因素(如温度、湿度、安静、振动等)的影响,使测量值发生误差。所以,在进行诊断时必须对仪器、药品、条件等等有严重的规定。 2)被观察者的个体生物学变异:如血压值在上、下午、冬夏季不相同。血糖值在饭前、饭后不相同,身体上下肢、左右侧反应不尽相同等。此时,同一测量者用同一方法对同样被观察对象的测定结果也有不同。因此,应严格规定观测的条件(如时间、部位等)。 3)观察者的变异:包括观察者自身的变异(如不同时间、条件时)和观察者之间的变异。如数人筛检高血压时,必须预先经过训练,使几名观察者判断同一人同时的血压值差异在0.26kPa之内。 对诊断方法的可靠性,可以用变异系数(coefficient of variance)来表示。 (式5-10) 另外,还可以用不同观察者的符合率来判断其可靠性。 减少影响可靠性的方法:检查方法应标准化,观察者应经过严格的训练、方法准确、简单、不要采大量血、不要引起被观察者疼痛或不舒服等。此外,诊断指标不要订的太多、不要不管有否相关,只要本单位有的检查就一齐都用上。后者徒增加经济开支。 (2)真实性:对称有效性。诊断试验的真实性是测定值与真实值相符合的程度。评价诊断试验的真实性通常用该诊断试验的灵敏度、特异度(当然就有假阳性率和假阴性率)。人们希望所用的诊断试验方法是灵敏度和特异度都高的。可是从图5-3可见,将分界线向右移,则提高特异度,但灵敏度下降。而将分界线向左移,则提高灵敏度,但特异度就下降。 (二)灵敏度与特异度的关系 前节已谈到二者的关系为一个提高,则另一个下降。反之亦然。其关系可以表5-2为例。 表5-2 不同血糖水平诊断糖尿病的灵敏度、特异度
血糖水平标准(mg/dL)灵敏度(%)特异度(%)
9098.67.3
10097.125.3
11092.948.4
12088.668.2
13081.482.4
14074.391.2
15064.396.1
16055.798.6
17052.999.6
18050.099.8
19044.399.8
摘自Lilienfeld AM,1980 同样,误诊率(假阳性率)及漏诊率(假阴性率)也有如此关系。 确定以什么数值作为诊断标准,有一个要求确定误诊率与漏诊率哪个率小的问题。请参见附录六。 选择诊断标准时,一般按下列原则选定。 liuxingbingxue053.gif患病率与预测值的关系 图5-5 患病率与预测值的关系(Vecchio.1966) 1.当假阳性及假阴性的重要性相等时,一般可把诊断标准定在“特异度=灵敏度”的分界线处,或定在正确诊断指数最大处。 2.有些严重疾病 如能早期诊断则可获得较好的治疗效果,否则后果严重。此时应选择灵敏度高的诊断标准,保证所有病人尽可能被筛检及诊断出。但特异度会同时降低,假阳性增多,需要进一步确诊的可疑病例即增多,从而增加检查成本。 3.治疗效果不理想 确诊及治疗费用较贵时,则可选择特异度较高的诊断标准。 灵敏度(真阳性)与假阳性(1-特异度)的关系,可以受试者作业特征曲线(receiver operator characteristic(ROC)curve)表示,见图5-4。
7-3

三、预测值

预测值(predictivevalue)又称预告值、诊断价值。一个诊断方法有其一定的特异度、灵敏度,但是当应用它筛检或诊断患病率不同的人群时,阳性(或阴性)结果所表示的意义却不同。 在临床工作中每日要遇到看化验单的结果,在得到一个阳性(或阴性)结果时,如何判断其诊断价值。这时就需要参考该被检查者是处于高患病率人群还是低患病率人群。当患病率很低时,即使一个特异度很高的试验也会检出相当多的假阳性,比如用ELISA方法检测AIDS病的HIV抗体,就会出现许多假阳性,而必须再用第二次的ELISA或蛋白印迹法(western blot)或其他方法确诊。 一个试验的阳性预测值说明被试人如为阳性时他有该病的阳性率有多大;阴性预测值说明阴性时他没有该病的可能性有多大。按表5-1的符号,表示如下: (式5-10)(式5-11) 在不同患病率的人群中,阳性结果的预测值不同。如表5-3。在患病率为2%时阳性预测值为29%,而患病率为1%时,阳性预测值仅为17%。 图5-5表示一个灵敏度及特异度均为95%的试验,在不同患病率时的预测值。由图可见患病率低时,阳性预测值很低。因此,在患病率较高的人群中进行筛检较有意义。如糖尿病筛检可在年龄超过40岁及家庭有糖尿病史的人中进行,以节省人力、物力。 表5-3 特异度为95%,灵敏度为99%的诊 断试验在不同患病率人群中的阳性预测值
项 目患病率
1%2%
(1)人数10001000
(2)确实有病人数1020
(3)确实无病人数990980
(4)试验阳性﹝(2)×0.99﹞10(应为9.9)20(应为19.8)
(5)试验假阳性﹝(3)×(1-0.95)﹞50(应为49.5)49
(6)总阳性数﹝(4)+(5)﹞6069
(7)阳性预测值﹝(4)/(6)﹞10/60=17%20/69=29%
兹再举Sketch所作冠状动脉狭窄的诊断研究为例,加以说明。 冠状动脉狭窄有很多诊断方法,其中最确切的诊断方法是动脉造影,但因方法复杂和费用高,有人提出用分级踏旋器应力试验(graded treadmill stress test),也即运动试验,系运动后观察心电图变化的一种试验用作诊断,来代替造影。怎样评价这个新诊断方法?首先要与诊断最确定的动脉造影试验作比较。在作比较时采取“盲目”的原则,不使试验者知道动脉造影的情况。 Sketch取了一个195个病人的样本。动脉造影以动脉狭窄≥75%作为异常,而运动试验以心电图判断异常。结果见表5-4。 liuxingbingxue055.jpg血糖测定诊断糖尿病的ROC曲线 在患病率高的男病人组中运动后心电图与冠状动脉造影的比较 图5-4 血糖测定诊断糖尿病的ROC曲线 在患病率高的男病人组中运动后心电图与冠状动脉造影的比较
运动后心电图异常冠状动脉造影显示≥75%狭窄合计
55(α)7(b)62
49(c)84(d)133
合计10491195
从表5-4可以计算如下数字: 灵敏度=α/(α+c)=55/104=53% 假阴性率=c/(α+c)=49/104=47% 特异度=d/(b+d)=84/91=92% 假阳性率=b/(b+d)=7/91=8% 患病率=(α+c)(α+b+c+d)=104/195=53% 阳性预测值=α/(α+b)=55/62=89% 阴性预测值=d/(c+d)=84/133=63% 该作者在结论中说:“阳性结果在预测存在显著的冠状动脉狭窄的男人中是有用的,但阴性结果并不能用来排除显著的冠状动脉狭窄。” 上述例子的患病率为53%,在患病率低的人群中(如参加体育锻炼的人),该试验的诊断价值如何?试验结果如表5-5。 表5-5 在患病率低的男病人组中运动后心电图与冠状动脉造影的比较
运动后心电图异常冠状动脉造影显示≥75%狭窄合计
554297
49478527
合计104520624
灵敏度=55/104=53%  (与前表相同) 假阴性率=49/104=47% (与前表相同) 特异度=478/520=92%  (与前表相同) 假阳性率=42/520=8%  (与前表相同) 患病率=104/624=17% 阳性预测值=55/97=57% 阴性预测值=478/527/91% 当患病率降至17%,同一试验阳性预测值下降至57%,阴性预测值上升至91%。如果一个病人运动试验为阳性,很难预测他有显著的冠状动脉狭窄存在,而如为阴性则很可能排除他为冠状动脉狭窄患者。与表5-4的情况恰相反。 由上述例子来看,患病率的高低与一个诊断方法有很密切的关系,临床医师为了正确判断一个试验结果的诊断价值,不能不去了解患病率。再举例说明如何评价分级应力试验对一些病人的诊断价值。如有一个30岁的男人,从未有过绞痛似的胸痛。根据临床研究及经验,这种人所代表的样本,有冠状动脉狭窄的“患病率”大约是5%。另一个病人是62岁的男人,有典型的心绞痛,这种人所代表的样本的“患病率”大约是94%。对前者(30岁)进行运动试验,则阳性预测值为26%,阴性预测值为97%。这样,这个试验对这30岁的年轻人几乎没有什么诊断价值。因为试验如果是阴性,仅仅告诉我们他不像患有冠状动脉狭窄,这在临床上也不像。如果是阳性,年轻人有该病的可能性并不大,不能以此来决定做一步的诊断试验,如冠状动脉造影。这个试验对62岁有心绞痛的病人也没有很多帮助。如果试验是阳性则该病人有冠心病的机会只从94%上升到99%,这本来临床医师很容易判断为有病。如果是阴性,则有冠心病的机会只降至89%,很难用来确定是否需要作进一步的诊断试验。 这个运动试验的重要用途可能在于临床上不太有把握的病例。假如有一个45岁的男人,有不典型的绞痛。临床研究表明这种人所代表的样本,有46%的可能性是冠状动脉狭窄。这个人是否需要做血管造影?假如做了运动试验,阳性预测值是85%,则临床医师认为需要时,是应该做血管造影的。阴性预测值为70%,因此,试验阴性就不需要作进一步的检查了。也可以这样说,有冠状动脉狭窄的可能性不太低或不太高时,进行运动试验是有价值的。而在太低或太高时,没有什么更多的诊断价值,因为临床表现已经很清楚了。 同样的诊断试验在基层门诊部和在专科医院应用时,其阳性预测值并不相同。因为一般在基层门诊部病人的某病患病率比在专科医院低,所以其阳性结果的预测值一般低于在专科医院。 知道一个试验方法的灵敏度、特异度,被测人群某病的患病率,即可计算出当试验结果为阳性(或阴性)时,该人患病的概率。 (式5-12)(式5-13) 按上述两个公式,临床医生可以根据某人所处的阶层的某病患病率,预测该人有无该病的概率。
7-4

四、似然比

某试验阳性的似然比(likelihoodratio,LR)或阳性似然比,如表5-1所示,其计算公式如下。 (式5-14) 阳性似然比即正确判断阳性的可能性是错判阳性可能性的倍数。此值愈大,此诊断方法愈好。 (式5-15) 阴性似然比即错判断阴性的可能性是正确判断阴性的可能性的倍数。此值愈小,此诊断试验方法愈好。 按180例经手术证实的急性阑尾炎或不是阑尾炎,其右下腹反跳痛的阳性似然比与阴性似然比如下。 表5-6 180例手术证实有、无阑尾炎
反跳痛有阑尾炎无阑尾炎合计
阳 性801696
阴 性206484
合 计10080180
liuxingbingxue059.jpg 当一名腹痛病人就诊时,如果怀疑该病人患急性阑尾炎的可能性(患病率,验前概率,pretest proba-bility)为50%,则患与不患急性阑尾炎的机遇为1:1(验前概率比,pretestodds)。 验前概率比=验前概率/(1-验前概率)(式5-16) 按此病人应该=0.5/(1-0.5)=1:1 进一步检查有反跳痛,其阳性似然比=4,验后概率比(post-test odds,检查机遇)=验前概率比×阳性似然比(式5-17)=1×4=4。 验后概率(post-testprobability)即该病人患阑尾炎的可能性=验后概率比/(1+验后概率比)=4/(1+4)=80% 结论:病人应该按急性阑尾炎治疗。 如果反跳痛阴性,阴性似然比为0.25。 验后概率比=(1:1)×0.25=0.25:1,该病人患急性阑尾炎的可能性=0.25/(1+0.25)≈0.2=20%。 结论:该病人应当被进一步观察,或做其他检查。 当了解许多症状、体征在某些病的似然比后,可以利用其进行多重试验检验。在进行诊断时,把前一次检验的验后概率作为下一次检验的验前概率,继续运用,直到可下结论为止。举例如下。 一位45岁妇女主诉突发左侧胸痛月余,来门诊就医。该患者是否患冠心病? 查胸痛原因很多,如①肺或胸膜疾患;②上消化道疾病;③冠心病;④情绪影响;⑤其他原因。仅只按其主诉,她患冠心病的可能(验前概率)仅为0.01。 验前概率比=验前概率/(1-验前概率)=0.01/(1-0.01)=0.01。 进一步询问其疼痛特点,有放射至左臂内侧的特点。其阳性似然比为100,此时,其验后概率比=0.01×100=1。 诊断冠心病的概率(验后概率)=验后概率比/(1+验后概率比)=1/(1+1)=0.50=50%。 当再给她做心电图检查,ST段下降2.2mm,其阳性似然比为11,验前概率比=0.5/(1-0.5)=1。验后概率比=1×11=11。验后概率=11/(1+11)=11/12=91.67%。 再进一步检验其血清肌酸磷酸酶(CPK)>80单位,此时阳性似然比为7.75。其验后概率比=[0.9167/(1-0.9167)]×7.75=85.25。验后概率=85.25/(1+85.25)=0.988=98.8%。 经过询问症状,心电图检查及血清CPK检查,该病人患冠心病的可能性为98.8%,因此可以明确诊断该病人患冠心病。
7-5

五、正常与异常

临床上遇到的最常见问题之一是该现象(病人的症状、体征、诊断试验结果等)是正常或异常。因为进一步研究、治疗或观察都取决于是正常还是异常。如果正常与异常区分得很清楚,没有重叠,这个问题不难解决。但实际情况是正常与异常有一部分重叠,而更常见的是只有一个分布,异常者只是在此分布曲线的一端。此时临床医师作出实际的决定时,可以应用如下三种方法。
(一)将普通作为正常
通常临床医师把常见的作为正常,而把罕见情况作为异常。此时常在频数分布上选取一个任意的截断点(临界点,cut-off point)作为正常与异常的区分。通常以平均值之上或之下2个标准差作为截断值。如果为正态分布,则通常有2.5%的人被确定为异常。如果不是正态分布则可以用百分位数法。如果用双侧检验则从2.5百分位数到97.5百分位数为正常值,如单侧检验,测量数值过大为不正常则上限定于第95百分位数(percentile)作为截断值;如果测量数值过小为不正常,则定在第5百分位数,其下为异常。那么在人群中不正常者即被确定为5%。
这种分法是人为的,没有生物学基础。而且有些情况,如血压、血清胆固醇,在正常值范围内也随着数值的上升而心血管疾病的危险性在上升,大部分冠心病死亡者的血清胆固醇是在“正常”值范围,只有少部分是在高水平。
(二)异常与疾病相联系
第二个标准是按正常健康者与病人的分布,选取一个明确的截断点以区分正常与异常。但是,常常这两者有相当的重叠,有时几乎不能明确分开。几乎永远有一些正常人在截断点的病人侧(假阳性,误诊),而有一些病人在截断点的正常人侧(假阴性,漏诊)。这种情况可以用灵敏度、特异度表示。根据需要漏诊率(或误诊率)哪个小,而定截断值。另外,可用绘制ROC曲线法,选取其左上角拐弯处之点作截断值,既考虑到灵敏度,又考虑到特异度。还可以约登指数最大时的测量值为正常或异常的分界点。
(三)按可治疗界限划分
由于上述两种分法来区分正常与异常的困难,引出另外一种方法,用随机对照试验来确定区分标准。即根据在什么标准时进行治疗可以利大于弊。这种方法是临床实践中摸索出来的。
如对于高血压的治疗,关于舒张压正常值范围就历经多次变动。60年代中期定为14.0kPa,70年代又定为12.0kPa,1985年英国医学研究理事会(Medical Research Coun-cil)认为按12.0kPa可能有些治疗过度,此标准目前又有往上提的趋势,即定为12.7kPa。这也是WHO关于高血压的诊断标准(SBP≥21.3kPa及(或)DBP≥12.7kPa)。治疗高血压标准从1955年至1985年曾有过几次变动。确定诊断标准时应参考其可否减少病死率及(或)发生并发症为依据。此外,还应参考其费用、效益等加以确定。

7-6

六、临床诊断的分歧及一致性的判断

诊断标准确定后,判定诊断结果时在诸多环节可能出现不一致性,而当诊断错误后又可能严重影响下一步的治疗,以及预后等。 (一)发生临床不一致性的环节 临床意见不一致,可发生于收集病史、体格检查、实验室检查结果的解释以及诊断、治疗等等诸多环节。 1.由于询问方法不一致,常易出现不一致性。据某医院两位高年医师对同一批溃疡病术后者询问病情,二人的意见一致率尚不足2/3。 2.体格检查 将一种体征误作为另一种体征,从而作出不同的诊断。 3.实验室检查结果的解释出现不一致性 如胸部X线片、运动后心电图的ST段及T波是否正常以及判断末梢血涂片是否缺铁。两位医生判断时很难取得一致结果。如曾有人试验,两位医生判断一批运动后心电图是否正常,符合率仅57%;同一医生两次读结果,两次符合率为74%。 4.诊断和治疗受医学界当时流行的认识的影响而出现结果不一致的预期偏倚如在50年代,医学界认为儿童的扁桃体约50%应该摘除。将389名儿童带至第一组医生进行检查,174人(45%)被诊为应当做扁桃体摘除,其余215名不需要做。将这215名儿童带至第二组医生检查,99人(40%)被判定应做扁桃体摘除,116人不需要做。这116人经第三组医生检查,其中51人(44%)被判定为应做扁桃体摘除。三组医生都判定自己所诊治的儿童约50%(44%~46%)应做扁桃体摘除术。实际上,第二、三组医生所诊断的儿童已被前一组医生判定为不需要做扁桃体摘除。这种偏倚叫预期偏倚。 (二)产生临床不一致的原因 1.观察者的原因 如诊断指标、诊断标准不一致,诊断分类不清,不同专业人员偏重从本专业出发考虑诊断标准。观察者(检查者)的感觉上的差异,得到不同结果。由预期结果影响而形成的诊断上的预期偏倚等等。 2.被检查者的原因 如被检查部位不同、时间不同,可以影响测定结果。 3.检查的原因 诊断仪器性能不良或用法不当造成测定结果不稳定,检查时环境杂乱影响对精密测定结果的判定等。 (三)防止临床意见不一致的方法 1.安排适当的诊断环境 如安静、光线适当、温度舒适等。 2.实验室检查结果的报告 应不受临床诊断的干扰(盲法、独立判断),按检查结果作出。 3.核实据以确定诊断的关键性资料 如复查病史、体征,采用适当的实验室检查法,引用旁证资料,请求会诊等。 4.报告结果时 附上客观检查证据,以便别人据以判断。 5.增用适当的检查设备、技术等。 对临床意见不一致性的分析,最主要的目的是检验用于临床科研资料的质量,据之作出诊断、治疗决策及预后判断的可靠性及重复性的程度。 (四)判断临床意见一致性的符合率-kappa值 由临床经验相似的甲、乙二医生阅读100张胸部X线片,二人均诊断肺门淋巴结结核46例,均诊断正常32例。观察一致率(observed agreement,PO)=。二人读片结果如表5-7。 表5-7 甲、乙二医生阅读胸部X线片诊断结果
甲医生诊断
乙医生诊断合计
肺门淋巴结结核正常
肺门淋巴结结核46(α)10(b)56(r1)
正 常12(c)32(d)44(r2)
合 计58(c1)42(c2)100(N)
按上表的分布,二人读片的机遇一致率(Pc,agreement expected on the base of chance )如下: liuxingbingxue061.jpg 非机遇一致率(potentialagreement beyond chance)=100%-51%=49% 实际一致率(actualagreement beyond chance,PO-PC)=78%-51%=27%。 (式5-18) Kappa值也可由表5-7各数字直接求得,公式为: (式5-19) Kappa值表示不同人判断同一批结果,或同一人不同时间判断同一批结果的一致性强度。Kappa值愈高表示一致性愈好。关于具体数值表示的强度,各家意见不完全一致。一般认为Kappa值在0.4~0.75为有中、高度一致,≥0.75为有极好的一致性
7-7

七、提高诊断质量的一些方法

提高诊断质量就是提高诊断方法的质量与可靠性。此时必须注意:①选择合适而正确的指标;对计量指标则应选择恰当的截断点;②尽量运用客观指标;③对指标的测量,要把方法及可能影响结果的步骤及条件都进行标准化。 由于一个诊断方法的诊断标准变动时,如提高灵敏度,必然以降低特异度为代价,反之亦然。如果既想提高灵敏度又不降低特异度,或反之,则可以选择多种指标的联合试验。可按下列方法配合,即平行(并联,in parallel)试验及系列(串联,in series)试验,如表5-8所示。 表5-8 联 合 试验 方 式
联合方式试验1试验2判断结果
平行试验
系列试验
不必做
(一)平行(并联)试验 用并联诊断指标进行诊断时,几个指标中有一个阳性即诊断为阳性。此法提高了灵敏度,但特异度有一定程度的降低。此法减少漏诊率。当漏掉一个病人后果严重时或再进行筛检费人力、物力时,要尽量减少漏诊率,则可采取平行试验。 诊断下肢深静脉血栓形式的“金标准”是静脉造影,但该法既贵又有危险,此时可以考虑用两种安全、方便但灵敏度稍差的方法进行平行试验。如两种方法的灵敏度都是74%,二法并联结果如表5-9。 表5-9 诊断下肢深静脉血栓形成的平行试验
平行试验结果静脉造影法合计
有病无病
两种方法均阳性或811091
任一方法阳性
两种方法均阴性5104109
合 计86114200
灵敏度=81/86=94% 特异度=104/114=91% 阳性预测值=81/91=89% 阴性预测值=104/109=95% 灵敏度由两个74%提高到94%,特异度也在可接受的高度(91%),阴性预测值95%,则得到阴性结果几乎可以排除诊断该病。 用A、B两种方法平行(并联)试验时,联合灵敏度(平)及联合特异度(平)如下: 联合灵敏度(平)=A灵敏度+[(1-A灵敏度)×B灵敏度](式5-20) 联合特异度(平)=A特异度×B特异度 (式5-21) (二)系列(串联)试验 用串联指标进行试验时,必须几个指标均为阳性才能诊断为阳性。如糖尿病筛检时可以先用尿糖试验,阳性时再进行血糖耐量试验。二者均为阳性才诊断为糖尿病。此种联合试验提高特异度,可以减少误诊率,但却增加了漏诊率。当误诊能造成严重后果时,应该用系列(串联)试验。 当诊断心肌梗死的三种酶(CPK,SGOT,LDH)试验,当用系列试验时提高特异度,灵敏度降低,但在可接受范围。如表5-10。 表5-10 诊断心肌梗死的酶试验的灵敏度、特异度
酶试验方法灵敏度(%)特异度(%)
CPK9657
SGOT9174
LDH8791
三法串联7895
当临床不必迅速作出诊断时,或目前几种方法特异度不太高,或必须进行某些贵或安全性差的试验时,可用此种联合方法。用此种联合方法时,先使用特异度较高的方法,可以减少下一步试验的人数,可以减少工作量,节省人力、物力及费用。费用昂贵或安全性差的试验可以放在后一步,第一步为阴性时,则下一步可省去,从而可达到节省费用、减少损伤的目的。对那些少见病、病死率高的病或一旦检出后能明显改善预后的疾病,则第一步可以用灵敏度高的方法,可以减少漏诊。第二步再用特异度高的方法。 此种联合试验,如有A、B两种试验,则: 联合灵敏度(系)=A灵敏度×B灵敏度 (式5-22) 联合特异度(系)=A特异度+[(1-A特异度)×B特异度](式5-23) (三)混合法 根据指标的性质和质量高低,将指标有串联有并联结合起来应用,以达到较好的结果。比如有四项指标,可定为有任何三项阳性判断为阳性,或第一项阳性再加上其他三项中任何一项阳性即判断为阳性,否则即诊断为阴性。 也可以考虑把几个指标结合成一个指标(如某某综合征),可以减少指标数目,以便于工作与分析。 当混用两个以上诊断试验时,常先选简便、易行、价廉、对被检查人无损伤的试验,后用复杂、价贵、可能有损伤的试验。 (四)其他提高诊断试验效率的方法 如设立专科门诊,必要时转诊或会诊疑难病例,对特殊临床表现人群进行检查,对高危人群、特殊暴露人群或某职业人群进行筛检等。