EP12-A2标准续篇:定性体外诊断产品一致性研究及数据分析
1. 引言
上篇文章中我们已经对如何进行偏差及不精确度研究的内容进行了分享,今天我们将继续学习EP12中定性体外诊断产品如何采用方法对比进行一致性研究的相关内容。
上篇:EP12-A2标准解读:定性体外诊断产品如何进行偏差及不精确度研究
原文链接:
https://mp.weixin.qq.com/s?__biz=Mzg5NzczMDE3OQ==&mid=2247497941&idx=2&sn=3381c95461b70931aa6917830cdbf5ff&chksm=c06feb39f718622f70c9ec482b2d38d863a06cd2d4966da5d758f7a8ccb3029be0baa6670424&token=245345838&lang=zh_CN#rd
下面,小编将继续梳理EP12标准中的方法比较原则和如何进行数据分析等相关内容分享给大家,希望能够对大家有一定的帮助。
2. EP12重点内容解读
本文中小编将详细讲述后两个章节相关重点内容(红色标识内容)。
2.1 比较方法
在一种常见的方法比较类型的研究设计中,用两种或两种以上的方法进行检验,并对结果进行比较。对比方法可能是另一种定性方法(如当前的同类HPV检测方法)或诊断准确性标准(如结合巴氏检查结果、阴道镜检查、组织学和随访)。
在评估候选方法时,该EP文件对“最高”和“较低”级别的比较进行了重要的区分。最高水平的比较为候选方法与诊断准确性标准进行对比。CLSI将诊断准确性标准定义为目前可用的最佳标准,采用单一方法、事件或方法组合,包括实验室检测、影像学检查、病理和临床信息、随访等。需要强调的是,随着分析系统的发展,诊断准确性标准将随着时间的推移而发展。诊断准确性标准没有考虑候选方法的结果(正在评估中的新测试)。
对于较低水平的比较,候选方法只能通过与另一种仔细描述的方法表征。在EP12中,这些其他方法(不是诊断准确性标准)被简单地称为比较方法。当一个候选方法通过与比较方法的比较来进行评估时,那么灵敏度和特异性这些术语并不适合用于描述比较结果。关于候选测试的正确性的信息不能被直接估计。相反,许多实验室可能用候选测试与比较方法的一致性来评估。
下面的部分描述了在设计方法比较研究时应考虑的内容。
1)测试样本
对于评估诊断准确性的研究,用于比较方法研究的患者标本应包括临床实践中预期的临床状态的代表性人群。
2)样本数量
在研究期间检测的样本总数取决于评估者对该方法的预期使用和疾病的流行率。例如,如果总共检测了100个样本,并且实验室样本人群中的疾病流行率为5%,大约5个样本将有阳性结果,约95个样本将有阴性结果。这可能是一个足够的样本量来评估特异性,但没有足够数量的阳性结果样本来评估灵敏度。评价者可用的选择是一直测试样本,直到使用比较方法获得期望数量的阳性结果和阴性结果。作为最低要求,测试应该持续到用候选和比较方法都获得至少50个阳性样本和50个阴性样本的结果。如果在检测50个阴性和50个阳性样本时,该方法的估计灵敏度和特异性各约为90%,则置信区间将为78%至97%——宽度为19个百分点。如果测试了更多的样本,置信区间将会更窄。如果能接受更宽的置信区间,则可以测试更少的样本。
3)持续时间
使用临床样本的对比试验应该在10-20天内每天进行。将测试分散到不同天,这样用户可以获得具有代表性的样本数量,并在更典型的实验室使用下评估候选方法。如果可行,评估期间测试的所有标本应妥善保存,以供额外测试,以解决有问题的结果。对于不一致结果可以使用具有相同比较方法的另一种测试或临床诊断进行分析。
4)收集过程中的数据检查
所有数据都应立即进行记录和检查,以便及早发现分析系统或人为错误的可能来源。如果确定部分结果是由于可解释的错误,应注意错误情况,数据不应包括在数据分析中。如果无法确定出现差异的原因,请在数据中保留原始结果。
5)差异性结果
候选方法和比较方法之间的差异可能由于比较方法的错误或候选方法的错误结果导致。当比较方法不是100%有效时,可以通过诊断准确性标准对候选方法和比较方法之间的结果存在差异的样本进行测试,以提供可能有助于解决差异的结果。
6)参考样本盘
以前测试过的临床样本,或参考了定义良好的方法或有效的临床诊断,对定性方法的评估是有用的。这些参考面板或挑战面板是可取的,因为每个标本的真实价值都是确定的,并可追溯到一个特征良好的方法或临床诊断。参考小组可能被政府机构、监管机构、行业、专业协会或文献引用所认可。但也有局限性,例如不能体现疾病流行率。
2.2 数据分析
1)以诊断准确性标准为对比试剂
定性测试的性能最常见的描述是体现在灵敏度和特异性方面。Table 1是一个2 x 2的交叉表,它比较了定性测试的结果与诊断准确性标准的结果。下表描述了该试验的灵敏度和特异性、预测值等的计算方法。

灵敏度= [ TP/(TP+FN)] ×100%
特异性= [ TN/(FP+TN)] ×100%
流行率= [(TP+FN)/N ] ×100%
阳性预期值= [ TP/(TP+FP)] ×100%
阴性预期值= [ TN/(TN+FN)] ×100%
如果真阳性率(灵敏度)与假阳性率(1−特异性)相当,则该检测对疾病检测没有诊断价值。另一方面,灵敏度和特异性均接近100%的检测具有较高的诊断价值。
① 灵敏度和特异性的置信区间
灵敏度和特异性的精确置信限(Clopper-Pearson方法)可以从二项分布中计算出来,并且可以通过许多统计软件包计算。另外,Altman等人,推荐了一种简单、直接的计算方法,称Score-Wilson法。关于上述方法何时不合适的统计参数超出了EP12的范围。
建议使用Score-Wilson法计算置信限,并描述如下:
· 对于灵敏度:

其中Q1,se, Q2,se, and Q3,se 可用Table 1中的数据计算出来:


其中Q1,sp, Q2,sp, and Q3,sp 可用Table 1中的数据计算出来:

在上述公式中,1.96是来自标准正态分布的分位数,其对应于95%的置信度。如果需要一个不同的置信水平,则应该使用相应的分位数来代替1.96。
② 比较两种测试的灵敏度和特异性
如果用户可以接受定性检测的灵敏度和特异性,则可能不需要进行额外的数据分析。但是,如果还想要确定候选方法和旧方法的性能之间是否存在统计学上的差异。那么候选方法和旧方法都还需要与诊断准确性标准进行独立的比较。

注意,表2中的数据可以用于以表1的形式构造两个表(一个用于候选方法,另一个用于旧方法),但反之则不行。也就是说,用户不能用只知道表1的每种对应方法来构建表2(候选方法vs诊断准确性标准,以及比较方法与诊断准确性标准)。为了构建表2,需要对每个受试者/样本的候选方法、比较方法和诊断准确性标准的三向结果。表1中没有包含这种三种方式的结果。
候选方法的表1中的(TP、FP、FN、TN)可以来自表2,计算公式如下:
可以来自表2.webp)
通过表2可以得出,候选方法的灵敏度为:

旧方法的灵敏度为:

差异为:

同样,对应特异性计算公式为:


相应的置信区间及差异计算,小编就不详细描述公式的推导过程了。
2)采用非诊断准确性标准为对比试剂
在比较方法不是诊断准确性标准的常见情况下,一般我们不能轻易估计灵敏度和特异性。这时候可以比较候选检验与对比方法的一致性PPV、NPV。
① 候选试剂和对比试剂间的一致性比较
当诊断未知时,可以生成2 x 2的结果表以及进行候选方法和比较方法一致性评估。需要注意的是,将表2最后两列的结果相加,可得到表3中的结果。

Percent positive agreement (candidate method) = 100×a/(a+c)
Percent negative agreement (candidate method) = 100×d/(b+d)
Overall percent agreement = 100×(a+d)/n
② 置信区间的计算
· 对于一致性的置信区间:

其中Q1, Q2, and Q3 分别为:

· 对于PPA的置信区间:

其中:

· 对于NPA的置信区间:

其中:

3)举例
· 诊断准确性标准为对比试剂

灵敏度= [ TP/(TP+FN)] ×100%=57/61×100%=93.4%
特异性= [ TN/(FP+TN)] ×100%=39/41×100%=95.1%
流行率= [(TP+FN)/N ] ×100%=61/102×100%=59.8%
阳性预期值= [ TP/(TP+FP)] ×100%=57/59×100%=96.6%
阴性预期值= [ TN/(TN+FN)] ×100%=39/43×100%=90.7%
灵敏度:二项分布法计算95%置信区间为 84.1% to 98.2%.
score(wilson)法计算95%置信区间为84.3% to 97.4%.
特异性:二项分布法计算95%置信区间为83.5% to 99.4%
score(wilson)法计算95%置信区间为83.9% to 98.7%
· 候选试剂,旧方法和诊断准确性标准的三方比对

灵敏度对比:


特异性对比:


· 对比方法为非诊断准确性标准

PPA=100%×285/299 = 95.3%
PNA=100%×222/237 = 93.7%
然后分别计算其二项分布法和score(wilson)法的95%置信区间,这里小编就不一一展示了。3. 结语
以上是对EP12-A2:定性测试性能评价用户协议中如何采用方法对比进行一致性研究的解读。
通过这篇文章,相信大家对于使用不同的对比试剂时,何时采用灵敏度、特异性或阳性一致率、阴性一致率来表征有了正确的认知,同时对于置信区间的计算也有了更清晰的了解。