本次比賽主題較佳搜尋策略:
1. computer$ adaptive test$ .tw.
2. limit 1 to yr=2006-2012
3. 1&2
4. limit 3 to humans
這樣可以搜尋得出近兩百篇studies,可以開始瀏覽篇名與摘要篩選符合主題的文章。
若是需要再收斂結果,可排除特定publication type的文章,如:
RCT
Clinical trials
Follow-up studies
Descriptive studies
(補充)陌生領域文章搜尋策略
1. 找出2-3篇符合搜尋目標的文章,使用這些文章中的key words, text words以及mesh terms
2. 從original paper開始,搜尋有那些文章cite過這篇原始文章
3. 從最新的文章開始,就要看這篇文章引用了哪些相關文獻
4. Pubmed搜尋引擎中,每一篇文章右方會顯示"related articles",也可從此找到相關文獻
2012年2月6日 星期一
2012年2月3日 星期五
資料檢索大賽交件
Goal: 彙整2006年迄今發表於期刊論文且測量健康相關 construct 之CAT
Search Engine: PubMed
Strategy:
1. Health Status Indicators[mesh] 160867
2. computerized[Title/Abstract] AND adaptive[Title/Abstract] AND testing[Title/Abstract] 178
3. 1#2 26
4. ("2006"[Date - Publication] : "2012"[Date - Publication]) AND #3 13
Comments:
1. Not any PROMIS studies are included.
2. The mesh term “Health Status Indicators” might not be a suitable term for its narrower definition.
3. The related mesh term for ‘’computerized adaptive testing” has not be found by me.
Results: 10 papers fit in my expectation
2012年1月13日 星期五
多向度IRT統計諮詢
諮詢對象:業太
諮詢問題:
多向度IRT分析中,使用不同的節點(nodes)得到的結果不同。以目前SF-36使用於海洛因病人的研究為例,使用三種分析方法:一階段,nodes=200;一階段,nodes=2000;二階段,nodes=2000得出之結果不同。
目前的了解是,二階段2000 nodes的分析方法為最"精準"的分析。然而, 各向度信度值表現最佳(希望可以>0.9)的部分為一階段200 nodes的分析。
回答:
Conquest手冊中提及nodes= 400已足夠用來估計試題參數,但不足以精準估計能力的變異共變數矩陣(Sigma),而Sigma又跟EAP信度估計有關。nodes=1000~2000為手冊中建議的設定
在模擬研究中,此設定被認為可良好回覆Sigma。因此,若report nodes=200時的信度,其實是高估了真實的信度。
除了估計精準度之外,global model-data fit也需同時考量。二階段分析減低了一階段分析受限於疊代的起使值不適當之影響,進一步提升global model-data fit。fit良好且參數估計精準為較理想的分析結果
綜合以上,建議採用二階段nodes=2000的信度數據( 雖然數據較不理想)
諮詢問題:
多向度IRT分析中,使用不同的節點(nodes)得到的結果不同。以目前SF-36使用於海洛因病人的研究為例,使用三種分析方法:一階段,nodes=200;一階段,nodes=2000;二階段,nodes=2000得出之結果不同。
目前的了解是,二階段2000 nodes的分析方法為最"精準"的分析。然而,
如果回報一階段200 nodes的結果, 來證明多向度分析能夠使向度信度值提升至臨床可接受(>0.8 or >0.9)的範圍,這樣的使用是否可行?
回答:
Conquest手冊中提及nodes=
在模擬研究中,此設定被認為可良好回覆Sigma。因此,若report nodes=200時的信度,其實是高估了真實的信度。
除了估計精準度之外,global model-data fit也需同時考量。二階段分析減低了一階段分析受限於疊代的起使值不適當之影響,進一步提升global model-data fit。fit良好且參數估計精準為較理想的分析結果
綜合以上,建議採用二階段nodes=2000的信度數據(
2011年10月26日 星期三
回覆審查者意見心得
*早上與老師奮戰兩小時,確認與修正了六七成回覆審查者意見的稿件,以下為幾點心得記錄提醒自己:
1. 審查者的功用為幫助我們發現文章盲點,因此當審查者有誤解的地方,很有可能也是未來我們文章會造成讀者誤解之處。因此藉由審查者的建議,能夠幫助看清文章的問題所在,並藉由修改文章以提升可讀性。
2. 須留意語氣及措辭,避免直接反駁審查者之論述。若真有名詞定義上的落差,須提供文章中採用該名詞定義之文獻支持以澄清之。
1. 審查者的功用為幫助我們發現文章盲點,因此當審查者有誤解的地方,很有可能也是未來我們文章會造成讀者誤解之處。因此藉由審查者的建議,能夠幫助看清文章的問題所在,並藉由修改文章以提升可讀性。
2. 須留意語氣及措辭,避免直接反駁審查者之論述。若真有名詞定義上的落差,須提供文章中採用該名詞定義之文獻支持以澄清之。
2011年9月21日 星期三
IRT 多向度分析問題與解答
使用軟體:Conquest
諮詢對象:業太
諮詢對象:業太
問題 | 回答 |
1.使用export與import指令,分兩階段計算,與直接一步驟計算的差異在哪裡? | 1.由於Conquest完成一次疊代所需的時間較長,因此先以節點較少(例如100、200)的分析了解資料的大致走向後,再以節點較多(例如2000)的分析進行計算。 2.兩步驟的另一個優點為,第二次分析的起始點不為0,為第一次分析所得出的數值,會較重新跑一次分析來的精確。 |
2.在刪題過程中,若是發現需要刪除被限制住難度為0的題目時,此時可以調整限制難度為0的題目接續分析,還是需從頭開始分析? | 理論上來說,調整format response不會影響各個題目(除了原先被限制住的那一題)fitting的好壞,所以是可以接續分析的。 |
3.eap檔與shw檔,數據幾乎相同,有何分別? | 一般在output中會出現三個檔案:itn、eap以及shw檔。itn顯示古典分析底下的統計量、shw顯示現代測驗理論底下的統計量、eap顯示個人能力估計值。 |
4.分析結束後出現warning:「Convergence has occurred but a solution with a higher likelihood was encountered at iteration XXX. The result for this earlier soulution will be retained……. | 該warning指出,在第316次疊代的結果比目前疊代結果來的好(likelihood值較高),因此將保留第316次疊代的參數估計。程式還建議以第316次結果作為初始值,再一次進行參數估計程序。這時,便可以使用上課中提到的export與import指令,進行兩階段分析。 |
5.若是有刪題的情形,分析前出現warning:「Parameter(X)for item X, is not identified… | 該警告訊息旨在說明第1題因為被移除,所以不估計該題參數 |
6.若有刪題的情形,分析前出現warning:「You will have to recode the data before estimation can proceed」的指令 | 原因出在當設定平均難度為0時 各向度的最後1題被限制住不進行估計,因此當要刪除的題目為最後一題時會發生這樣的情形。解決方式為調整format的題號順序,讓被刪除的那一題難度不會被限制住。例如: format responses 1-8,10,9,11-30; 但此時需注意label也必須同時調整。且題序改變之後,原始資料的第10題已被設定為9,第九題已被設定為10,因此若是要刪除第十題,指令為 delete items(9)。 |
2011年7月29日 星期五
BI研究計畫閱讀心得
閱讀文件:進階專題職能治療專題書面報告--三層面巴氏量表發展
作者:李雅珍
心得:
作者於文中陳述日常生活活動(Activities of daily living, ADL)能力可區分為三個層面:執行能力和實際表現(Bootsma-van der Wiel et al. 2001; Smith and Clark 1995)、自覺困難程度(E. A. Grimby, Gunnar 2000)。作者於引用上應將Bootsma-van der Wiel et al. (2001)這一篇置於執行能力和實際表現一詞後面(原文引用位置有誤),同時建議增加G. Grimby et al. (1996)這一篇,因為在這一篇文獻中,有說明自覺困難程度於臨床應用上的意義:
……rating difficulty in doing various activities is the primary assessment of disability, whereas rating of dependence is an assessment of the effect of disability……
此外,本研究作者評量執行能力的方式,為建立一標準化情境,直接進行能力施測。然而,在Smith 和Clark (1995) 以及Bootsma-van der Wiel等人(2001)的研究中,皆是使用相同問卷題目,改變語句修飾的方式進行評估。作者改變評估的方式,或許應說明與過去評估方式的不同,以及修改的目的,以突顯出此評量方式的重要性與獨特性。
作者於本研究中,將執行能力、實際表現以及自覺困難程度視為ADL的三個向度,我認為這是個相當有趣的問題。因為在上述四篇文獻中的閱讀中,我所形成的假設模型為:「執行能力」對於「實際表現」的影響,會受到「自覺困難程度」的調節;亦即我會將這三個變項,視為三個獨立的量表所測出來的概念。然而作者將此三者視為ADL底下的三個向度,以下是我的看法:
1. 執行能力與實際表現視為ADL的一體兩面,因此將其歸為ADL的兩個面向。然而自覺困難程度為何可納入ADL的向度中,或許還需要更多的論述以佐證。
2. 作者於後續分析中規畫進行建構效度的分析,在變項的測量上,實際表現與自覺困難程度使用病人報告結果(Patient Reported Outcome),而執行能力卻是使用評估者評估,變項在測量的基準上有些許的差異,是否會影響分析結果的解釋,有待進一步的探討。
由文獻中,可以發現到執行能力、實際表現以及自覺困難程度在個案ADL的探討中都是不可或缺的一部分,我相信藉由這個研究的進行,能夠協助臨床工作者更深入的了解病人需要協助的部分,以進行更有效的介入。
2011年7月27日 星期三
心理學中指涉domain的中文用語
諮詢對象:姚開屏教授
中文翻譯
domain=範疇
dimension=向度
facet=層面
意義澄清
1.在因素結構上,domain類似於dimension,兩者之間可以互用。
facet 在前二者之下,用於多階層因素架構時。
2.以WHOQOL-100為例,分為六個大向度/範疇(生理、心理、獨立、環境、社會、個人信念),底下分為29個層面(例如:疼痛、活力、自尊......等)
*****************************************
補充說明(個人看法)
1.factor (因子/因素),在意義上個人認為是domain、dimension、facet等的統稱,因為在因素分析上我們定義factor就是用少量的因子/因素來解釋許多測量變項(在問卷中就是每一個題目)的變異量。因此不論是單階層或是多階層的因素結構,裡面的domain/dimension 或是facet都可以稱做factor(因子/因素)。
2.construct若是單獨存在,指的是構念,意思為研究者感興趣的心理量,亦即問卷的主題,例如:生活品質、幸福感等。
construct validity,在此稱為建構效度,為效度的一種,驗證理論上構念的架構(例如:構念底下可分為幾個向度,每個向度又對應那些題目?)
中文翻譯
domain=範疇
dimension=向度
facet=層面
意義澄清
1.在因素結構上,domain類似於dimension,兩者之間可以互用。
facet 在前二者之下,用於多階層因素架構時。
2.以WHOQOL-100為例,分為六個大向度/範疇(生理、心理、獨立、環境、社會、個人信念),底下分為29個層面(例如:疼痛、活力、自尊......等)
*****************************************
補充說明(個人看法)
1.factor (因子/因素),在意義上個人認為是domain、dimension、facet等的統稱,因為在因素分析上我們定義factor就是用少量的因子/因素來解釋許多測量變項(在問卷中就是每一個題目)的變異量。因此不論是單階層或是多階層的因素結構,裡面的domain/dimension 或是facet都可以稱做factor(因子/因素)。
2.construct若是單獨存在,指的是構念,意思為研究者感興趣的心理量,亦即問卷的主題,例如:生活品質、幸福感等。
construct validity,在此稱為建構效度,為效度的一種,驗證理論上構念的架構(例如:構念底下可分為幾個向度,每個向度又對應那些題目?)
2011年4月19日 星期二
IRT分析SF-36(Physical Health component)練習
個案數:490
量表:SF-36 (Physical Health Component)
題數:21題
計分方式: PF(10)= 1,2,3 RP(4)=1,2 BP(2)=1,2,3,4,5 GH(5)=1,2,3,4,5
程式碼
分析流程
1.以MNSQ (0.6~1.4) 作為刪題標準。
2.刪除至剩餘題目滿足Criteria,或是某一向度內題目完全被刪除前停止。
3.完成刪題後,觀察信度值以及殘差主成分分析是否會分出dominant factor
分析結果
1.以RSM分析,連續進行三次刪題後,發現除了PF向度之外的題目幾乎都會被刪除;進行至第二次刪題後停止,信度值0.82,殘差主成分分析還可分出一個主要因素(26.3%)。
2.以PCM分析,結果相似。
推論
SF-36不滿足單向度假設。
老師建議:
1.單以MNSQ來看並不足以解釋Rasch底下的單向度假設,還需看題目間的ICC是否pattern一致。
2.將Physical component底下的四個domain分開來做IRT,看看適配的情形。若是四個向度適配狀況不錯,可考慮使用多向度IRT分析。
3.參考過去使用IRT分析SF-36的文獻。
4.將程式碼寄給恩琦,請她看分析程式是否有需要更正的地方。
量表:SF-36 (Physical Health Component)
題數:21題
計分方式: PF(10)= 1,2,3 RP(4)=1,2 BP(2)=1,2,3,4,5 GH(5)=1,2,3,4,5
程式碼
&INST TITLE='SF-36 IRT try' DATA=SF36.txt NI=21 CODES=123456 NAME1=1 ITEM1=4 ISGROUPS=111111111122223300000 /*for RSM only*/ GROUPS=0 /*for PCM only*/ PRCOMP=S TFILE = * 1.2 3.1 2.4 3.2 10.1 12.6 20.1 23 * IFILE=item.txt PFILE=people.txt SFILE=step.txt ICROFILE=residual.txt &END PF1 PF2 PF3 PF4 PF5 PF6 PF7 PF8 PF9 PF10 RP1 RP2 RP3 RP4 BP1 BP2 GH1 GH2 GH3 GH4 GH5 END NAMES |
分析流程
1.以MNSQ (0.6~1.4) 作為刪題標準。
2.刪除至剩餘題目滿足Criteria,或是某一向度內題目完全被刪除前停止。
3.完成刪題後,觀察信度值以及殘差主成分分析是否會分出dominant factor
分析結果
1.以RSM分析,連續進行三次刪題後,發現除了PF向度之外的題目幾乎都會被刪除;進行至第二次刪題後停止,信度值0.82,殘差主成分分析還可分出一個主要因素(26.3%)。
2.以PCM分析,結果相似。
推論
SF-36不滿足單向度假設。
老師建議:
1.單以MNSQ來看並不足以解釋Rasch底下的單向度假設,還需看題目間的ICC是否pattern一致。
2.將Physical component底下的四個domain分開來做IRT,看看適配的情形。若是四個向度適配狀況不錯,可考慮使用多向度IRT分析。
3.參考過去使用IRT分析SF-36的文獻。
4.將程式碼寄給恩琦,請她看分析程式是否有需要更正的地方。
2011年4月6日 星期三
IRT 1P model 分析操作觀念澄清
諮詢對象:業太
| 詢問內容 | 已知概念 | 希望澄清的概念 | 概念澄清 |
| MNSQ v.s. ZSTD | 在進行fit index的判準時,藉由MNSQ 和 ZSTD 的Infit & Outfit index可以檢驗題目是否符合單向度假設模型。一般來說criteria定為0.6~1.4 | 在實際分析上,發現MNSQ值理想,但ZSTD值卻很高,有些甚至達到9,此時應如何判準? | 雖然MNSQ值與ZSTD值都是計算期望值與觀察值差距的總和,但ZSTD經過標準化的轉換後,其數值特性易受樣本大小的影響。在本例中樣本數達2500人,因此ZSTD值膨脹是可預期的。一般來說,在分析上會以MNSQ值為主。 |
| Missfit刪除item | 當部分題目Missfit的情況下(Infit & Outfit任一不符合或是兩者都不符合,端看研究者的信念),將題目予以刪除,只保留符合單向度假設模型的題目。 | 第一次分析刪除Missfit的題目後,再進行第二次分析,發現又有部分題目Missfit,是應該一直重複這樣的動作,直到完全沒有Missfit的題目,還是進行一次就停止? | 這個問題沒有標準答案,一樣是端看研究的需求和研究者的信念。在第二輪中變成Missfit的題目,通常在第一輪的分析中就已經是接近於臨界值勉強被保留下來的題目,表示若是將其刪除才是真正保留了單向度的假設存在;而若是題目數本來就不多,或是題目在臨床上有意義時,研究者可以將第二輪才表現不佳的題目予以保留,但須做充分的說明。 |
| PCA判斷標準 | 以殘差的主成分分析來判斷,未被主要因素解釋的變異量中,是否可被分出其他的主成分。理想上應不會發現任何的主成分。 | 判斷的標準何在? | 取特徵值皆小於1.4或是任一因素解釋變異比例不超過20%。惟特徵值小於1.4的條件過於嚴苛,現今已被許多學者質疑,因此取20%的標準即可。 |
訂閱:
文章 (Atom)