מהי קנה מידה של ציון?

כאשר מפתחי המבחנים מדווחים על ציוני המבחן למשתמשים הסופיים (מנהלי בתי ספר, מורים, הורים, המבחנים עצמם, או משתמשי הציון האחרים האפשריים), חשוב שהמשמעות של הציונים המספריים שדווחו תהיה ברורה וקלה לשימוש. אם לא, אז מה הנקודה של ציוני המבחן?

ניתן לקבל ציוני מבחנים במגוון רחב של סוגים. שמרו ... בדיוק.

לדוגמה, התוצאות בחלק מהמבחנים מדווחות במונחים של מספר תשובות נכונות או אחוז התשובות הנכונות. דיווח כזה שימושי במקרים שבהם כל משתתף במבחן מבצע בדיוק את אותו המבחן, כמו במקרה של מבחנים ליניאריים, בצורה קבועה.

המבחנים של STAMP (STAndards-based Measurement of Proficiency) משתמשים, לעומת זאת, בשיטות פסיכומטריות ובפיתוח מבחנים מודרניים יותר והם לא מבחנים ליניאריים. כל מבחני הקריאה וההאזנה של STAMP מתאימים למחשב, מה שאומר שרמת הקושי של המבחן מתאימה בזמן אמת ליכולת השפה המשוערת של כל מבחן. זה מוביל למדידה מדויקת יותר של יכולת השפה של מבחנים ומספק חוויה נעימה יותר למבחנים מאשר בדרך כלל המקרה עם מבחן ליניארי, מאחר ומבחנים לא ייתקלו במספר גדול של פריטים הרחוקים מאוד מתחת או מעל לרמת היידע הממשית שלהם. השיטה החזקה זו של הרכבה והפצה של מבחנים אפשרית רק באמצעות שיטה פסיכומטרית שנקראת תיאוריה של תגובה לפריט (IRT). ב-IRT, כל פריט מבחן (כלומר שאלת מבחן) משויך לרמת קושי שנמדדה באופן מדעי. במקרה של STAMP, רמת הקושי של כל פריט במבחן מחושבת דרך ניתוח IRT של תגובות של מאות (וברוב המקרים, אלפים) מבחנים ייצוגיים. זה מאפשר לנו לכייל את הפריטים לפי רמת הקושי שלהם ולוודא שרק הפריטים הטובים ביותר משמשים בכל מבחן STAMP.

אלגוריתם הניקוד של STAMP משתמש גם במידע זה על קושי הפריט כדי לחשב את הרמה הסופית של STAMP של כל מבחן, בהתאם לפריטים שהם ניסו לפתור במהלך המבחן, תגובתם לכל פריט, והיכולת שמבחנים צריכים להציג כדי לקבל ציון בכל אחת מרמות STAMP (האחרונה נקבעת דרך תהליך שנקרא הגדרת סטנדרט). לכן, בהתחשב באופן המותאם של ההערכות של STAMP ובהתחשב בכך שלכל פריט יש רמת קושי סטטיסטית מסוימת שמשויכת אליו, דיווח על הציונים של STAMP במונחים של מספר תשובות נכונות (למשל, 23 מתוך 30) או אחוז תשובות נכונות (76.6%) אינו משמעותי ולא מתאים.

כפי שנדון בקרוב, תיאורית תגובת הפריט (IRT), שמהווה את הבסיס הסטטיסטי לפיתוח ולדירוג של מבחני ה-STAMP של אוואנט, משתמשת בסולם דירוג שאינו אינטואיטיבי במיוחד למשתמשים הסופיים של מבחני ה-STAMP. לדוגמה, בסולם של IRT יש ערכים שליליים וחיוביים. להגיד למי שעובר בדיקה בדוח הציון שלו שרמת הקריאה שלו במבחן ה-STAMP 4S בגרמנית היא -1.4 לא יהיה מועיל ויפגע בדרישה לציונים ברורים וקלים לשימוש שנדונה לעיל. משום זאת, נדרש שערכי הציון של STAMP המבוססים על IRT יומרו לסולם ציונים יותר משמעותי וקל לפרשנות. סולם הוא בעצם ספקטרום של ערכי מדידה אפשריים ומפתחי המבחן נדרשים להחליט על נקודות ההתייחסות של סולם הציונים לפני שניתן לדווח על הציונים.

הבנת נקודות ההתייחסות של משקל ...

שלושה מדידים שקוראים כנראה מכירים הם מדידי הטמפרטורה בצלזיוס, פרנהייט וקלווין. למרות שכולם הם מדידים של טמפרטורה, נקודות ההתייחסות שלהם והפרשנות שלהם שונה באופן משמעותי. אותו דבר יכול להתייחס למדידים שונים המשמשים לדיווח ציוני רמת שליטה בשפה.

בסולם הצלזיוס, מעלה של 0 ℃ מציינת את נקודת המדידה שבה מים קופאים ברמת פני הים, בעוד שהערך המינימלי האפשרי למדידה בסולם הצלזיוס הוא -273.15 ℃, שהוא הנקודה שבה אין פעילות מולקולרית כלל בחומר. בסולם הפרנהייט, לעומת זאת, נקודת המדידה שבה מים קופאים ברמת פני הים היא 32 מעלות F, לא 0 מעלות F. בסולם הפרנהייט, - 459.67 F מציינת את הערך המינימלי האפשרי למדידה, כאשר אין פעילות מולקולרית בחומר. כפי שאנו רואים, באף אחד מהסולמות, צלזיוס או פרנהייט, אפס לא משמעו באמת היעדר מוחלט של משהו. זהו פשוט נקודת התייחסות שמשמעה מתגלה רק בהתייחס לסולם המדידה המלא ולערכים האפשריים והניתנים להשגה שלו. ...

לגבי סולמות הטמפרטורה, הסולם היחיד שיש לו נקודת אפס אמיתית הוא סולם קלווין. בסולם קלווין, נקודת המדידה 0 K באמת משמעה שאין פעילות מולקולרית כלל, כאשר האפס מסמן את הערך המינימלי האפשרי בסולם קלווין. בסולם קלווין, לכן, ערכים שליליים אינם אפשריים, בניגוד לסולמות צלזיוס ופרנהייט (וכפי שנראה בקרוב, גם בסולם IRT). שלושת סולמות הטמפרטורה אין להן גבול אמיתי לערכיהן המרביים, מאחר שאין גבול ידוע לכמה חם משהו יכול להיות.

אז, האם אפשר לומר באמת שסולם אחד הוא טוב יותר מהשני? לא באמת. שלושת הסולמות הם תקפים לחלוטין בפני עצמם ומשמשים באופן נרחב בהקשרים שונים, כאשר מסוימים מהסולמות מוכרים כיותר מתאימים על ידי המשתמשים, בהתאם להקשרים מסויימים. דבר אחד שמאחד את שלושת הסולמות הללו, עם זאת, והופך אותם למתאימים לחלוטין למדידה מדויקת, הוא העובדה שהמרחק בין שני נקודות מדידה כלשהן בסולם מציין את אותה ההבדל בטמפרטורה. במילים אחרות, ההבדל בפעילות המולקולרית בין 35 ℃ ל-37 ℃ הוא בדיוק כמו ההבדל בין 89 ℃ ל-91 ℃. זו מאפיין שאנחנו ב-Avant מאמינים שהוא בליבה של מדידה טובה, ובהחלט אחד שאנחנו משתמשים בו עבור הניקוד שלנו STAMP.

למרות השימושיות של הסקירה של שלושת סולמות החום המוכרות שלמעלה וההבנה כמה הן מתאימות להקשרים שלהן למדידת מושג כמו חום, חשוב להבין שחלק מהתכונות שיש להן הופכות אותן לבלתי מתאימות למדידת מושג כמו רמת שליטה בשפה. לדוגמה, יהיה כמעט בלתי אפשרי להסביר מה זה שליטה שלילית בשפה או איך מישהו יכול להיות ללא יכולת בשפה; אפילו אדם שלעולם לא למד או לא היה במגע עם שפה מסוימת בעבר יהיה לו ידע מסוים (אם כי מינימלי) של לפחות מילים שהועתקו מאותה שפה. אף מבחן שליטה בשפה לא יכול לטעון שלמישהו אין שום שליטה בשפה, מאחר שהוא לא יכול להעריך את כל התרחישים האפשריים בהם אדם עשוי להראות הבנה, אפילו בסיסית מאוד, של מילה או ביטוי בשפה. כל מבחני השפה מוגבלים על ידי הפריטים שנמצאים במבחן ומה הם מסוגלים למדוד, מה שאומר שלמבחני שפה עשוי לא להיות נקודת מדידה אפסית, אך ייתכן שיהיה להם נקודת מדידה מינימלית, שמייצגת את הנקודה מתחת להם המבחן אינו מסוגל להציג טענות. אותו דבר חל על הנקודה המרבית של ההתייחסות במבחן; לא משנה כמה פריטים יש במבחן, הוא לעולם לא יהיה מסוגל למדוד את כל שליטת השפה של אינדיבידואל. כך שסולם תקף למבחן שליטה בשפה כמו מבחני ה-STAMP יהיה לו נקודת התייחסות מינימלית (שמשמשת למשתתפים במבחן שענו לא נכונה על כל הפריטים שראו), לא יהיה לו נקודת התייחסות אפסית, ויהיה לו נקודת התייחסות מרבית (שמשמשת למשתתפים במבחן שענו נכונה על כל הפריטים שראו).

מדידת IRT והציונים של STAMP

כפי שנאמר לעיל, חשוב שמרווחים שווים בסולם המשמש לדיווח ציונים במבחן רמת שליטה בשפה מציינים את אותה ההבדל ברמת השליטה בשפה. כל הרמות מהמבחן STAMP (רמות 1 - 9) מיושרות לרמות התקן של שליטה בשפה בארה"ב (ממתחיל נמוך עד מתקדם גבוה), כפי שניתן לראות להלן:

למרות שמידות הSTAMP מיושרות לרמות היודעת של אלו ולמרות שישנה שימושיות ברמות היודעת להצבת רמת היכולת הכללית של מבחן בשפה, רמות התקנים עצמן אינן מתאימות לסוג הניקוד הממוספר הממוזג שאנו מחפשים. ראשית, משמעות ההבדל במרווח בין רמות התקנים הלאומיים ליודעת (ולכן STAMP) אינה אותה בלתי תלויה בנקודה על הסולם. לדוגמה, נדרשת יכולת שפה גבוהה יותר לעבור מרמה בינונית גבוהה (STAMP רמה 6) למתקדמת נמוכה (STAMP רמה 7) מאשר לעבור מרמה מתחילה גבוהה (STAMP רמה 3) לבינונית נמוכה (STAMP רמה 4). מהסיבה הזו בדיוק, רמות היודעת מתוארות כפירמידה הפוכה, ולא כמרובע או מלבן. שנית, למרות שימושיות רמות היודעת להצבת מקום של לומד שפה מסוים מבחינת יכולת השפה שלו, יתכן שתלמידים שקיבלו את אותה רמת STAMP בעצם יהיו בעלי יכולות שונות מעט בשפה ויענו נכונה על מספר שונה של פריטים במבחן STAMP, אפילו אם הם ראו בדיוק את אותם הפריטים דרך אלגוריתם ההתאמה של STAMP. לכן, למרות שימושיות החשובה של רמות STAMP והתקנים הלאומיים ליודעת בהבנת רמת יכולת השפה של מבחנים, רמות אלו אינן מפורטות כפי שחלק מהמשתמשים הסופיים של הציונים שלנו רוצים שהן יהיו.

לדוגמה, ייתכן שלבית ספר יש רק עשרה מקומות במחלקה המיוחדת לכבוד של קריאה בצרפתית. מה אם ארבעה-עשר מהתלמידים הגיעו לרמה 9 בSTAMP בקריאה? איך הבית הספר יכול לבחור עשרה מתוך ארבעה-עשר תלמידים למחלקה המיוחדת? בחירה אקראית של עשרה עשויה להיחשב כפתרון מקובל אך אנחנו ב-Avant Assessment יכולים לספק דרך טובה ומדויקת יותר לעזרה במקרה זה. כפי שצוין לעיל, Avant Assessment משתמשת בטכניקת מדידה סטטיסטית בשם תיאוריה של תגובה לפריט כדי לכייל את כל הפריטים במדדי הקריאה וההאזנה של מבחני STAMP (מותאמים), כדי להתאים את מספר השאלות שנכון למבחן לרמות STAMP ולכן לרמות התקנים הלאומיים של כישוריות שהם מתאימים להם, ולבסוף, ליצור תוצאות מדודלות שמספקות למשתמשי התוצאות מדד עדין יותר של יכולת השפה של כל מבחן מאשר היה אפשרי אם היו מדווחים רק על רמות STAMP.

מדידת דירוגי ה-STAMP

לאחר שכל הפריטים בחלק מסוים של מבחן STAMP כוללו בתהליך הכיול באמצעות IRT, אנו מסוגלים להקצות הערכת יכולת IRT (שנקראת גם תטא במינוח של IRT) לכל תלמיד, מבוססת על הפריטים שהם ענו נכון או טעו בהם בנתיב המסוים שהם הלכו בו בכל אחד מחלקי הקריאה וההאזנה של מבחן ה-STAMP שלהם. לאחר שיש לנו את הערך הזה, אנו מסוגלים להמר את הערך הזה (מה שמקנה לו את השם, מרת ציונים) כך שנוכל לדווח על ציונים מעודנים יותר, כדי להשלים את הדיווח על הרמה שהושגה ב-STAMP. על ידי מרת הציונים של IRT, אנו מסוגלים לוודא שכל הציונים המומרים הם חיוביים (אין ערכים שליליים) ושמשתמשי הציונים, כמו הבית הספר הצרפתי ההיפותטי שלמעלה, מסוגלים להתמקד יותר ברמת השליטה של התלמידים, אפילו אם התלמידים קיבלו את אותה הרמה במבחן ה-STAMP.

כל אחד מהמדולים של קריאה והאזנה של כל מבחן STAMP חייב להיות ממודד בנפה לחלוטין. לכן, הציונים הממודדים של קריאה בספרדית לא ניתן להשוותם ישירות עם הציונים הממודדים של האזנה בספרדית, או עם הציונים הממודדים של קריאה בסינית. במילים אחרות, הציונים הממודדים של STAMP הם ספציפיים לשפה ולמדול.

אנו משנים את מדד ה-IRT במדורי הקריאה או ההאזנה של כל אחד מהמבחנים שלנו באמצעות המרה ליניארית פשוטה, כפי שניתן לראות בנוסחה שלהלן: ...

ההתאמה המוזכרת לעיל מבטיחה שכל התוצאות המותאמות האפשריות למדד מסוים של מבחן STAMP הן מספרים חיוביים ללא ספרות עשרוניות, שהן הרבה יותר אינטואיטיביות מאשר ציונים הנעים בין -4 ל+4, שהם נפוצים יותר ב-IRT. ההתאמה הליניארית המופיעה בנוסחה לעיל מבטיחה גם שהמרחק בין שני ציונים מותאמים מציין את אותה ההבדל ביכולת בכל נקודה בסולם.

פרשנות של התוצאות הממוזגות ...

דמיין שיש לנו את התלמידים הבאים, שעברו את חלק ההאזנה של מבחן הSTAMP 4S ביפנית:

  • סטודנט A ציון מדוד: 589
  • סטודנט B ציון מדוד: 612
  • Student C ציון מדוד: 677
  • Student D ציון מדוד: 700

ההבדל ברמת השליטה בשמיעה ביפנית בין התלמיד א' ל התלמיד ב' ביפנית (23 נקודות מדודות) הוא אותו ההבדל שיש ברמת השליטה בשמיעה ביפנית בין התלמיד ג' ל התלמיד ד' (23 נקודות). אם שני התלמידים הגיעו לאותו הרמה STAMP בשמיעה ביפנית (לדוגמה, רמה STAMP 4 – בינוני נמוך), אך לאחד מהם יש ציון מדוד שהוא 20 נקודות מעל השני, יש לנו תמיכה חזקה להאמין שהתלמיד עם הציון המדוד הגבוה יותר משולט יותר מאשר התלמיד עם הציון המדוד הנמוך. ככל שההבדל בין הציונים המדודים שלהם גדול יותר, אנו יכולים להיות בטוחים יותר שההבדל הוא משמעותי וששני התלמידים אכן אינם שווים ברמת השליטה שלהם. הציונים המדודים יכולים גם להיות שימושיים במקרים שבהם נראה שתלמיד לא מתקדם לאחר שנה של לימוד ו"נתקע" באותה רמת שליטה. השוואה בין הציון המדוד שלהם לפני שנה והציון המדוד מהמנהיגה הנוכחית עשויה להראות רווחים קטנים ברמת השליטה שלהם, גם אם הרווחים האלה לא היו מספיקים כדי להעביר אותם לרמת STAMP הבאה.

יש לשמור על דבר אחד בחשבון, עם זאת: כל ההערכות מכילות שולי שגיאה מסוים הקשור לתוצאותיהן. לדוגמה, השגיאה התקנית של המדידה (SEM) שדווחה על ידי ETS עבור חלק ההאזנה של מבחן ה-TOEFL iBT, שמשתמש בסולם ציונים הנע מ-0 – 30 היא 2.38 נקודות מדודות (שירותי בחינות חינוכיות, 2018). לעומת זאת, עבור ציוני המדודה של מבחן ה-SAT, עם טווח ציונים של 200 – 800, השגיאה התקנית של המדידה היא 30 נקודות (לוח המכללות, 2018). מאחר ואין אפשרות להעריך כל תלמיד בימים רבים שונים, ובמאות פריטי מבחן, כל תוצאת מבחן היא תמונת מצב של הרמה שהמבחן הצליח להגיע אליה באותו היום המסוים שבו הוא ערך את המבחן, ובאותם הפריטים שענה עליהם במהלך המבחן. כמובן, מבחן כמו ה-STAMP 4S, שחלקי הקריאה וההאזנה שלו הם מתאימים למחשב, שכולל מספר גדול של פריטים שממקדים את הרמה המשוערת של כל מבחן בזמן אמת, ושפותח לפי תקנים איכותיים וכמותיים מחמירים, יהיה נוטה להכיל שגיאת מדידה קטנה יותר ולהיות יעיל ויעיל יותר מאשר מבחנים ליניאריים, לא מתאימים, קצרים שלא עוקבים אחרי אותה חמירות (שולץ, ויטני, & זיקר, 2014). השגיאה התקנית הממוצעת של המדידה עבור הציונים המדודים בחלקי הקריאה וההאזנה של מבחני ה-STAMP היא 10 נקודות מדודות. ניתן להגיע בקלות לסטטיסטיקה זו מהתוכנה של IRT שאנו משתמשים בה באוונט.

שגיאת המדידה המשויכת לתוצאות הSTAMP הממוזגות היא קטנה מאוד, בהתחשב בדיוק הפסיכומטרי ובאופן המותאם של המבחנים שלנו. אף על פי שאנו ממליצים שניתוחי ציוני המבחן יבוצעו בעיקר על פי הרמה שהושגה בSTAMP, אנחנו ב-Avant מציעים שתוצאות ממוזגות יכולות להיחשב במקרים מאוד מסוימים כאשר החלטות של משמעות גבוהה יותר צריכות להתבצע על פי ציוני המבחן של STAMP, כמו כאשר ציוני STAMP משמשים להעניק חותמות הדו-לשוניות של המדינה (SSB) או להעניק קרדיט על ידי מבחן (CBE). במקרים של החלטות של משמעות גבוהה יותר, אם ציון הממוזג של מנותן המבחן בקריאה או בהאזנה מסתכם להיות בתוך 10 נקודות או פחות מהציון הממוזג המינימלי שיכול להעפיל אותם ל-SSB או ל-CBE, המשמעת של Avant היא שבית ספר או מחוז יכולים, לפי שיקול דעתם, להכריח מנותני מבחן כאלה לחזור על מבחן הSTAMP (בהתחשב באופן המותאם שלו, יש סיכוי טוב שמנותני המבחן לא יראו בדיוק את אותם הפריטים כמו בהנחייה הקודמת). אם בהנחייה השנייה ציון הממוזג של מנותן המבחן מוביל לרמה של STAMP שמקיימת את הדרישות ל-SSB או ל-CBE, משמעת Avant היא שניתן להשתמש בציונים מההנחייה השנייה במקום ציונים מההנחייה הראשונה.

שני התרחישים שנדונו לעיל הם תרחישים בעלי סיכון גבוה יותר בהם ייתכן שיהיה ראוי לשקול את השגיאה הקטנה של המבחן (זכור שכל המבחנים יש להם שולי שגיאה).

אנו ממליצים שבאופן כללי יהיה מתאים להשתמש בתוצאות המדוד של STAMP לשימושים מסורתיים כמו לניתוח שנתי מתמשך או לצמיחת התלמידים ולהערכת התוכנית.

כדי לראות את הטבלאות של התוצאות הממוזגות שכרגע זמינות עבור ההערכות של STAMP, לחץ כאן. 

הפניות: 

College Board (2018). SAT: הבנת התוצאות. נלקח מ- https://collegereadiness.collegeboard.org/pdf/understanding-sat-scores.pdf

שירותי בדיקות לימודיות (2018). אמינות והשוויאות של ציוני TOEFL iBT. סדרת התובנות ממחקר TOEFL (כרך 3). אותר מ www.ets.org/s/toefl/pdf/toefl_ibt_research_s1v3.pdf

שולץ, ק. ס., ויטני, ד. ג'., & זיקר, מ. ג'. (2014). תיאוריה של מדידה בפעולה. מקרי לימוד ותרגילים (מהדורה שנייה). לונדון/ניו יורק: ראוטלג'. לוח המחלקה (2018). SAT: הבנת התוצאות. הורד מ- https://collegereadiness.collegeboard.org/pdf/understanding-sat-scores.pdf

שירותי בדיקות למידה (2018). אמינות והשוויית של ציוני TOEFL iBT. סדרת מחקר TOEFL (כרך 3). הורד מ- www.ets.org/s/toefl/pdf/toefl_ibt_research_s1v3.pdf

שולץ, ק. ס., ויטני, ד. ג'., & זיקר, מ. ג'. (2014). תיאוריה של מדידה בפעולה. מקרי עיון ותרגילים (מהדורה שנייה). לונדון/ניו יורק: ראוטלדג'.

Updated:
ינואר