顯示具有 心理計量 標籤的文章。 顯示所有文章
顯示具有 心理計量 標籤的文章。 顯示所有文章

2014年10月27日 星期一

Testlet Response Theory & Testlet-Based CAT

為解決建構CAT-HEALER可能遇到的題組問題,日前鑽研了一下題組反應理論之概念與CAT之應用方法,重點紀錄如下:

局部獨立性 (local Independence)為IRT之前提假設之一。局部獨立性可分為兩部分:局部試題獨立性 (local item independence, LII)與局部受試者獨立性 (local person independence, LPI)。LII是指當受試者能力已知時,該受試者在某試題上的作答反應與其它題無關。LPI則為當試題難度已知時,不同能力的受試者在該試題上的作答反應間相互獨立。二者皆須滿足才算符合局部獨立性的假設。

然而在教育測驗中,經常出現多道試題共用相同情境的情況,例如:閱讀測驗,由一篇文章衍生多道試題,此些試題的作答反應必有高度的相關性,產生題組效應 (testlet effect),違反局部獨立性之假設。此時,Testlet Response Theory (TRT)為可行的分析方法之一。
題組效應是指受試者的作答反應除了受試者能力影響以外,亦受到題組的潛在因素影響。


TRT與IRT同,具有一參數、二參數與三參數模型。不同點為:TRT將題組效應 (γ)放入模型估計,將題組效應γ與被試能力θ 分別估計,即θ與γ獨立。 
以Rasch Testlet Model為例:


Testlet-Based Computerized Adaptive Testing (TBCAT)
第一階段先選取最大訊息量的題組,第二階段則由該題組的所有試題中選則訊息量最大的試題,受試者提供作答反應後,電腦進行能力估算,再依據受試者的能力提供最大訊息量的下一題(同一題組)。若達預設標準,例如:同一題組只選2題(共10題),則換下一題組。

TBCAT之選題方式介於Computerized Multistage Testing (CMT)與Item-Based Computerized Adaptive Testing (IBCAT)之間。TBCAT屬於多階段選題 (CMT)。以試題為單位選題,作答完一試題後即進行能力估算,故無法返回重填 (IBCAT)。每位受試者作答的題目亦不盡相同 (IBCAT),即便能力相仿者,可能作答難度相仿的不同題組,或同一題中難度相近的不同,以避免試題曝光度太高。(即題組與試題皆為適性選題)

p.s. CMT為多階段選題,以題組為單位選題,同一題組所包含的題目固定。受試者完成一題組後電腦再依據該題組的作答結果進行能力估算,再挑選下一題組。能力相仿者,可能作答難度相近的不同題組,但若作答相同題組,每位受試者之作答題目皆相同(題組內有10題,則大家都作答這10題)。


TRT之應用實例
1. Wang X, Baldwin S, Wainer H, Bradlow ET, Reeve BB, Smith AW, et al. Using testlet response theory to analyze data from a survey of attitude change among breast cancer survivors. Stat Med. 2010;29:2028-2044  (醫學領域的文章,目前僅找到這一篇)
2. Eckes T. Examining testlet effects in the testdaf listening section: A testlet response theory modeling approach. Language Testing. 2013

2014年10月24日 星期五

Rasch analysis之單向度指標

1. item fit: infit & outfit之MNSQ趨近1。
(ZSTD易受樣本大小影響,樣本大,容易超過|2|)

2. principal component analysis of Rasch residuals:
(1) 可被主要評量概念所解釋的變異佔總變異的 >60%(部份研究使用較寬鬆的標準為>50%)
(2) 殘差中第一個主成份可解釋的變異<5%的總變異
(3) 殘差中第一個主成份的特徵值 (eigenvalue)  <3.0(較嚴格的標準為<2.0,因至少2個題目方能構成1個dimension,<2表示殘差中最主要的成分並不能形成第2個dimension)


References:
1. Linacre JM. A user's guide to winsteps. Chicago: Winsteps.com.; 2005.
2. Bond TG, Fox CM. Applying the rasch model: Fundamental measurement in the human sciences. NJ: Erlbaum: Mahwah; 2007.
3. Cervellione KL, Lee Y-S, Bonanno GA. Rasch modeling of the self-deception scale of the balanced inventory of desirable responding. Educational and Psychological Measurement. 2009;69:438-458
4. Shih MM, Rogers JC, Skidmore ER, Irrgang JJ, Holm MB. Measuring stroke survivors' functional status independence: Five perspectives. Am J Occup Ther. 2009;63:600-608

floor/ceiling effect之臨床與研究意義

若評估工具具有floor/ceiling effect,顯示此工具對於該群樣本來說太難/太簡單,以致無法將最低分/最高分的人區隔開來(即便能力極差或極好,個案的能力還是有差異),也無法正確估計這些人的真實能力程度。如此可能產生以下三影響:
1. ceiling effect:工具題目太簡單,得到滿分不能保證個案能力真的沒問題。mild impairment的個案可能有問題但工具無法呈現。 
2. 由於不確定個案的真實能力,難以提供適性、個別化的介入。
3. 此工具無法偵測病人能力的退步 (floor effect)或進步 (ceiling effect)程度。容易高估 (floor effect)/低估 (ceiling effect)療效。

在心理計量特性之驗證方面,若評估工具具有floor/ceiling effect,因分數聚集在最低分/最高分,降低分數之variation,容易低估評估工具的效度、信度(內部一致性)。此外,有floor/ceiling effect的評估工具反應性較差(同前述第3項)。

2014年10月16日 星期四

降低Cronbach's alpha的可能原因

Cronbach's alpha主要受到題目間相關 (Pearson's r)與題數影響。降低Cronbach's alpha的可能原因有:
1. 多向度(多向度會降低alpha值,但alpha值高不代表量表是單向度,要以因素分析驗證)
2. 樣本分數的variation太小 (e.g., floor / ceiling effect),降低題目間的相關
3. 題目為二分變項,而其背後的概念是連續的,此時Pearson's r會低估兩概念的相關程度
4. 題數太少(5~10題為佳,超過20題會高估alpha)

2013年9月30日 星期一

信度、效度與反應性之關係_0930更新

在老師提出「反應性之前提為效度與信度」的說法不久後,我的reviewer正巧也英雄所見略同地問了我類似的問題,請我解釋為什麼某一評估工具的反應性不好。
在重覆思考老師的論述與過去研究所述 (Hays & Hadorn, 1992),以下為我整理出信度、效度與反應性之關係:


評估工具具備反應性的前提是其須有良好的效度,而評估工具具備良好效度之基礎為具備良好的信度。也就是說有好的信度才可能有好的效度,有好的效度才可能有好的反應性。


補充老師的看法:信度與效度有些交集,但不是很多。也就是二者共同為反應性之基石。
但我不太理解老師的意思是下圖中的哪一種?



2013年9月7日 星期六

信度之概念與方法



討論問題:
為何樣本同質性高會低估信度?
→由ICC之概念公式來看,信度代表個體間變異佔所有變異之比重。亦即若個體間變異大,代表施測者間變異之比重小,可謂具良好的施測者間信度。然而若收案之樣本變異小,除可能有代表性不足的限制,亦可能低估信度。再者,SEM受baseline SD影響大,而MDC又容易受SEM影響,故若樣本變異小(SD小),亦可能低估SEM與MDC。

2013年8月15日 星期四

心理計量暑期作業_結果

研究目的:台灣簡明版世界衛生組織生活品質問卷 (WHOQOL_BREF)與歐洲生活品質問卷 (EQ-5D)應用於職災勞工之初步心理計量特性驗證

分析結果: 
表一、樣本之人口學特性與各變項評估結果 (n=1378)
人口學特性
 
 
性別
男/女
892 / 486
年齡
平均數(標準差)
41.1 (13.8)
家庭環境
婚姻狀況
已婚/未婚、離婚或鰥寡
829 / 549
未成年子女
無/有
837 / 541
教育程度
國中以下/高中職/大專以上
531 / 572 / 275
疾病史(系統疾病/重大外傷)
無/有
847 / 531
住院天數
1週以下/超過1
733 / 383
受傷機轉
車禍/工地意外/機器傷害/其它
694 / 350 / 262 / 37
因工作受傷
否/是
658 / 720
符合職災標準
否/是
896 / 429
WHOQOL_BREF
 
 
生理層面
 
 
0個月
平均數(標準差)
59.62 (12.07)
3個月
平均數(標準差)
61.66 (11.49)
心理層面
 
 
0個月
平均數(標準差)
63.87 (10.52)
3個月
平均數(標準差)
60.26 (8.43)
社會層面
 
 
0個月
平均數(標準差)
65.85 (12.61)
3個月
平均數(標準差)
61.67 (7.57)
環境層面
 
 
0個月
平均數(標準差)
64.12 (9.35)
3個月
平均數(標準差)
58.82 (9.33)
EQ-5D指標
 
 
0個月
平均數(標準差)
.39 (.28)
3個月
平均數(標準差)
.86 (.18)
 
表二、WHOQPL_BREFEQ-5D之心理計量特性 (n=1378)
 
WHOQOL_BREF
EQ-5D
生理層面
心理層面
社會層面
環境層面
內部一致性 (α)
.62
.63
.78
.68
.63
收斂效度 (r)
 
 
 
 
 
EQ-5D
.36
.17
.09
.11
-
區辨效度 (t)
 
 
 
 
 
疾病史
6.67
5.94
4.52
3.76
2.43*
住院天數
5.68
.88
-.10
2.13*
8.98
因工作受傷
-6.26
-3.33
-1.21
1.06
-3.55
符合職災標準
-4.49
-3.64
-2.03*
-.55
-2.39*
預測效度 (r)
 
 
 
 
 
3個月工作情形
-.29
-.22
-.14
-.21
-.32
反應性
 
 
 
 
 
0-3個月 (t)
.69
8.54
7.18
11.38
-37.54
ES (d)
.04
.45
.38
.63
1.60
SRM
.03
.38
.32
.51
1.67
*p.05p.01 p.001

WHOQOL_BREF中,除生理層面之分數為隨著時間增加外,個案之心理、社會與環境三層面生活品質於傷後3個月的分數較0個月初評時低。然而,EQ-5D指標卻是隨著時間漸增。可能原因為EQ-5D之評量範疇較偏重生理生活品質。由收斂效度之結果亦可發現,EQ-5DWHOQOL_BREF之生理層面具中度相關,與其它三層面僅低度相關。

        WHOQOL_BREF之心理計量特性驗證結果發現:(1) 社會層面的內部一致性尚可,生理、心理與環境三層面之內部一致性不佳。(2) 有無重大外傷或系統性疾病之患者於四層面之分數皆有顯著差異;住院1週以內與超過1週之個案的WHOQOL_BREF分數,僅生理與環境二層面之分數差異達顯著;是否因工作受傷之職災勞工僅於生理與心理二層面之分數差異達顯著;是否符合職災標準之勞工,除環境層面之分數外,其餘三層面之分數皆達顯著差異。顯示WHOQOL_BREF應用於職災勞工時,僅生理層面之區辨效度最佳。(3) WHOQOL_BREF四層面之分數皆與職災勞工傷後3個月之工作情形達低度相關,顯示WHOQOL_BREF之預測效度差。(4) WHOQOL_BREF之生理層面之反應性差,心理與社會二層面之反應性小,環境層面具中等的反應性。

EQ-5D之心理計量特性驗證結果發現:(1) 內部一致性不佳。(2) EQ-5D指標與WHOQOL_BREF四層面總分具低至中度相關,顯示EQ-5D之收斂效度為差至中等。(3) 有無重大疾病史、住院1週以內或超過1週、是否因工作受傷,以及是否符合職災標準等各組職災勞工之EQ-5D指標皆具顯著差異,顯示EQ-5D之區辨效度良好。(4) EQ-5D分數與個案傷後3個月之工作情形達中度相關,顯示EQ-5D之預測效度中等。(5) EQ-5D之反應性良好。