信度、效度、反应度与最小临床重要差异
/ MCID /
一件测量工具只有在你能信任它时才值得使用,而信任它意味着要追问几个尖锐的问题。当其实什么都没变时,它会不会给出同样的答案?它真的测的是它声称要测的东西吗?当真的发生改善时,它能不能察觉?而如果分数确实变了,多大的变化才大到对本人有意义?这四个问题就是一件结局测量的测量学特性——把有意义的数字和误导人的数字区分开来的质量检查。
信度问的是这件工具是否一致——当本人没有变化时,两位检查者(评定者间)或同一位检查者两次(重测)能否得到接近的结果;一件因偶然而给出差异极大分数的工具,就像一台你每次踩上去读数都不同的浴室秤。效度问的是这件工具测的是不是它打算测的东西——一项主要反映腿部力量的平衡测试,其实并没有在测平衡。反应度(也叫对变化的敏感性)问的是当本人发生改善或退步时,这件工具能否捕捉到真正的变化,而不是本人在变、它却一动不动。而最小临床重要差异,即MCID,是本人真正能察觉并看重的最小分数变化——一分的变化也许在统计上是真实的,却小到没人能感觉到。
这些特性之所以重要,是因为康复靠数字运转,而一个特性差的数字会造成伤害:信度弱的工具让你追逐噪声,效度弱的工具自信地测着错误的东西,而一个小于MCID的变化可能被当成成功来庆祝,本人却毫无不同的感受。了解它们,能让临床医生为问题选对工具、设定诚实的目标、批判性地阅读一项研究。关键的谦逊在于:这些特性并不是固定的标签,而是取决于场景和人群——一件在脑卒中中可靠又有反应度的测量,到了另一种疾病里表现可能相当不同。
一项研究报告说,一种新疗法把平衡分数提高了2分,在统计上是显著的。但这项测试的最小临床重要差异约为5分,所以这个变化虽然真实,却小到病人感觉不到——一个在纸面上看似成功、在生活中却意义不大的结果。
统计上显著与临床上有意义,并不是一回事。
这些特性不是永久的标签:一件在某种疾病或场景中可靠、有效、有反应度的测量,到了另一种里表现可能不同,所以良好的做法是问一句:这件工具是否在与眼前这个人相似的人群中被验证过。