Entry này là một phần của nội dung “tập huấn” mà tôi sẽ trình bày sáng mai tại một trường đại học trong TP HCM. Đại khái, có một trường nọ muốn xây dựng một ngân hàng đề thi tiếng Anh để làm tăng hiệu quả và chất lượng của công tác dạy – học của trường. Và trong mấy năm liền, BM này đã có những cố gắng viết/ tập hợp và phân loại những câu hỏi kiểm tra môn tiếng Anh theo một thiết kế được xác định sẵn. Đến nay, họ đã có được một tập hợp kha khá những câu hỏi được phân loại, và cũng đã thực hiện phân tích câu trắc nghiệm (item analysis) để tìm ra độ khó, độ phân cách của các câu trắc nghiệm của mình.
Mặc dù đã có những cố gắng nhưng BM vẫn lúng túng không rõ mình làm như vậy đã thực sự tốt chưa. Một số những câu hỏi đang được đặt ra là: Làm sao biết những câu hỏi của mình là thực sự tốt? Những tiêu chí cần đạt cho một câu hỏi tốt (một bài kiểm tra tốt) là gì? Quy trình đánh giá một câu hỏi hoặc một bài kiểm tra được thực hiện ra sao?
Các bạn có quan tâm đến vấn đề này cũng có thể search trên trang blog này nhiều bài viết khác của tôi về kiểm tra, đánh giá, và trắc nghiệm. Và nếu ai đọc mà có thắc mắc và muốn trao đổi thêm thì xin mail cho tôi nhé, vtpanh@gmail.com.
----
(i) Phương pháp “chuyên gia” (kiểm tra chéo)
- Phải có bản đặc tả trước khi xây dựng bài kiểm tra
- Hai chuyên gia xây dựng hai bài kiểm tra tương đương trên cùng một bản đặc tả
- Nhất thiết phải xây dựng xong đáp án trước khi kiểm tra chéo
- Chuyên gia đóng vai thí sinh (không được cung cấp đáp án) để làm bài. Thời gian hoàn tất bài kiểm tra của chuyên gia chỉ được bằng từ 1/2 đến 2/3 thời gian của thí sinh. Nếu chuyên gia phải tốn thời gian bằng hoặc hơn thời gian của thí sinh thì sẽ đánh giá không chính xác năng lực của thí sinh (quá khó hoặc quá ít thời gian).
- Những câu sai sẽ là cơ hội để hai chuyên gia trao đổi lại và đi đến thống nhất.
- Những tiêu chí đánh giá chất lượng câu hỏi/ bài kiểm tra: phù hợp với đối tượng và mục đích kiểm tra; có giá trị (kiểm tra được chính xác những gì mình muốn kiểm tra; điểm số có ý nghĩa rõ ràng, không gây tranh cãi); và đáng tin cậy (cho điểm số ổn định, không có những thay đổi bất thường khi thay đổi bối cảnh kiểm tra hoặc người chấm bài, vv). Ngoài ra, bài kiểm tra còn cần khả thi trong điều kiện của trường/ khoa/ bộ môn.
(ii) Phương pháp “thực nghiệm” (thử nghiệm trên mẫu)
- Mẫu thử nghiệm và đề kiểm tra phải thực sự tương đương với kỳ thi thật
- Sau khi thử nghiệm, cần thực hiện phân tích dữ liệu ứng đáp để tính độ khó và độ phân cách theo định nghĩa dưới đây:
- Độ khó = số thí sinh trả lời đúng/ tổng số thí sinh trả lời câu hỏi
- Độ phân cách = điểm trung bình của nhóm giỏi – điểm trung bình của nhóm yếu (tính trên đơn vị câu)
- Ý nghĩa của kết quả phân tích:
- Độ khó từ 0.2 đến 0.9 là dùng được, nhưng đa số nên nằm trong khoảng 0.3 đến 0.8. Những câu nằm ngoài phạm vi trên cần xem xét để điều chỉnh lại độ khó.
- Độ phân cách tốt khi có giá trị 0.3 trở lên. Tuy nhiên độ phân cách chỉ cần thiết cho những bài thi có tính cạnh tranh, hoặc cần phân biệt rõ các trình độ (vd placement test). Tuyệt đối không sử dụng câu có độ phân biệt âm. Độ phân biệt dưới 0.2 cũng có thể cần xem xét lại.
Showing posts with label testing and assessment. Show all posts
Showing posts with label testing and assessment. Show all posts
Friday, January 13, 2012
Sunday, October 30, 2011
Độ khó của văn bản và việc kiểm tra ngôn ngữ
Hôm nay nhân nói chuyện qua skype với cậu em, cũng là người cộng tác với tôi trong mấy đề tài trắc nghiệm mà tôi đã làm trước đây khi còn trẻ (hơn bây giờ một chút, hic), và còn hăng, tôi bỗng thấy hứng thú trở lại với những gì đã làm. Và cũng thấy tiêng tiếc là nhiều ý tưởng của tôi đưa ra đến giờ vẫn chưa áp dụng được, chẳng lẽ lại bỏ thì phí quá.
Thế là tôi cố gắng đi tìm lại những gì mình đã làm, đã viết, và tìm thấy bản mềm của Báo cáo nghiệm thu đề tài “Tiến đến tự động hóa quy trình soạn đề thi TN tiếng Anh” (2006) đã nghiệm thu thành công (đạt loại xuất sắc, hic). Để làm đề tài này tôi có đặt viết phần mềm, gọi là phần mềm ETGA (EnglishTest Generating Assistant), có lẽ bây giờ đã cũ về công nghệ (thì nghiệm thu đã 5 năm rồi, mà bắt đầu làm thì trước đó đến 2, 3 nên tổng cộng cũng phải gần chục năm rồi). Nhưng những ý tưởng của đề tài thì vẫn còn mới, và cho đến nay cũng chưa thấy áp dụng ở VN (buồn thật). Hình như ngành học của tôi không có cơ hội sống sót ở VN hay sao ấy nhỉ, ngày xưa thì có cụ Dương Thiệu Tống theo đuổi mãi, giờ hình như chỉ còn một mình tôi hay sao ấy, độc cô cầu bại (!). Chán thế.
Thôi thì đằng nào đề tài cũng xong rồi, nay đưa dần một số ý tưởng dễ hiểu, dễ nuốt trôi lên đây để chia sẻ với những người có quan tâm vậy. Hy vọng cũng có lúc có nhiều người hiểu và ứng dụng khoa học trắc nghiệm vào trong giáo dục, để mong rằng có thể góp tay nâng cao chất lượng của giáo dục VN lên đôi chút.
Entry này xin trích phần dễ hiểu và dễ áp dụng nhất đối với các giáo viên tiếng Anh và giáo viên ngoại ngữ nói chung, là phần nói về Readability mà tôi đã tạm dịch là “độ khó của văn bản” trong một bài viết từ năm 2002 ở trường ĐH KHXH-NV hồi ấy (đúng một chục năm rồi đó, mà ý tưởng này vẫn chưa được áp dụng, dù nó thật dễ làm sao!).
Thế này mà ở VN đòi tất cả mọi giảng viên phải làm nghiên cứu khoa học và ứng dụng được, thu tiền được, thì ở đâu ra? Hãy cứ dùng cái có sẵn cho đến nơi đến chốn, cũng đã mệt mỏi lắm rồi. Ví dụ như khoa học trắc nghiệm, ở nước người ta đã hơn 100 năm tuổi rồi, còn mình thì bây giờ vẫn còn cãi nhau về điểm sàn, thi cử vẫn cứ điểm thô mà phang, mà đưa ra mọi loại quyết định quan trọng đến vận mệnh học sinh, thì ôi thôi…
Biết rồi, khổ lắm, nói mãi!
Chú thích: Tựa nhỏ trong entry là những đề mục trong đề tài, bị cắt đứt đoạn nên có thể hơi khó đọc một chút. Ai có thắc mắc hoặc hứng thú xin gửi thư hỏi tác giả vtpanh@gmail.com.
-------
Xác định độ khó của văn bản và việc lựa chọn ngữ liệu cho các cho các bài kiểm tra ngôn ngữ
[...] Cho đến nay, việc chọn ngữ liệu để soạn thảo câu hỏi nghiệm hoàn toàn phụ thuộc vào người viết câu trắc nghiệm mà không có những tiêu chí thống nhất để đảm bảo rằng độ khó giữa các ngữ liệu nền được cung cấp trong các bài trắc nghiệm ở trình độ tương đương là thực sự tương đương. Tất nhiên, việc đưa ra một công thức chung để áp dụng cho mọi đối tượng ở mọi trình độ là điều không khả thi mà cũng không cần thiết vì mục tiêu kiểm tra đánh giá, trình độ và đặc điểm của đối tượng thí sinh của mỗi kỳ thi là khác nhau. Vì thế, vai trò của người làm đề thi với những kinh nghiệm và phán đoán của họ trong việc lựa chọn ngữ liệu phù hợp vẫn luôn luôn cần thiết và không thể thay thế. Tuy nhiên, thay vì hoàn toàn phụ thuộc vào phán đoán của từng người ra đề theo sử dụng phương pháp thủ công (tức mỗi người ra đề sẽ phải vừa đọc tư liệu và phán đoán sự phù hợp của từng đoạn ngữ liệu đối với mục đích kiểm tra), rất cần có những tiêu chí khách quan, đơn giản dễ sử dụng để hỗ trợ người viết câu trắc nghiệm trong việc lựa chọn ngữ liệu, vừa tăng hiệu quả sử dụng thời gian lại vừa đảm bảo giá trị của các câu trắc nghiệm do nhiều tác giả khác nhau biên soạn.
Một trong những yêu cầu hàng đầu của việc chọn ngữ liệu nền phục vụ biên soạn câu hỏi trắc nghiệm cho mọi môn học là ngôn ngữ phải rõ ràng, dễ hiểu và phù hợp với mức trình độ của thí sinh. Đối với môn ngoại ngữ, yêu cầu này lại càng quan trọng, nhưng chưa được chú ý đầy đủ trong các bài trắc nghiệm tiếng Anh được các chuyên gia trong nước soạn ra. Trong một nghiên cứu vào năm 2002 , chúng tôi đã nêu ra khá nhiều ví dụ về những câu trắc nghiệm có ngữ liệu nền quá khó đối với thí sinh khiến thí sinh không trả lời được câu hỏi, mặc dù vấn đề đang được kiểm tra hoàn toàn nằm trong nội dung chương trình cũng như năng lực của thí sinh. Vì vậy, để tăng tính khách quan của việc phán đoán sự phù hợp của ngữ liệu nền, chúng tôi đề nghị áp dụng công thức tính độ khó của văn bản tiếng Anh theo công thức Flesch (được tích hợp sẵn trong phần mềm MS-Word trên Windows) để giải quyết vấn đề này. [...].
Khái niệm độ khó của văn bản và việc lựa chọn ngữ liệu phù hợp với người đọc
Độ khó của văn bản là một khái niệm đã được đưa ra tại Mỹ từ những thập niên 30-40 của thế kỷ trước để giải quyết một vấn đề thực tiễn trong giáo dục là lựa chọn các loại sách đọc thêm phù hợp với trình độ ngôn ngữ của trẻ em, khuyến khích trẻ em yêu thích việc đọc sách và thúc đẩy phát triển khả năng ngôn ngữ. Bất cứ ai cũng có thể dễ dàng nhận ra rằng có những cuốn sách viết dễ đọc và có cuốn khác viết khó đọc hơn rất nhiều.
Điều gì đã tạo nên sự dễ đọc trong phong cách viết của các tác giả khác nhau? Từ lâu, các nhà nghiên cứu ngôn ngữ đã xác định được hai yếu tố chính có ảnh hưởng đến độ khó của văn bản là ý nghĩa và kết cấu ngữ pháp, được thể hiện qua hai đơn vị ngôn ngữ là từ (đơn vị chuyên chở nghĩa) và câu (đơn vị thể hiện kết cấu ngữ pháp), và đưa ra những phương pháp để lượng hóa 2 yếu tố này để làm cơ sở quyết định sự phù hợp của ngữ liệu đối với người đọc. Kết quả của việc lượng hóa hai yếu tố của độ khó của văn bản đã cho ra đời khái niệm “readability” mà chúng tôi tạm dịch là độ khó của văn bản (dịch sát nghĩa tiếng Anh là “tính dễ đọc” của văn bản).
Độ khó của văn bản được lượng hóa bằng một công thức tính khá đơn giản. Như đã nói ở trên, độ khó của văn bản phụ thuộc chủ yếu vào ý nghĩa của từ và cấu trúc của câu trong văn bản. Từ ngữ nào càng được sử dụng phổ biến thì càng nhiều người biết, tức càng dễ hiểu; và cấu trúc câu càng đơn giản, ít phức tạp, rối rắm thì càng rõ ràng, dễ đọc. Dựa trên những quan sát trên, các nhà giáo dục đã đưa ra phương pháp lượng hóa độ phức tạp của kết cấu ngữ pháp của văn bản bằng cách đo độ dài trung bình của câu theo đơn vị từ; cũng vậy, tính phổ biến của từ được lượng hóa bằng độ dài của từ tính theo âm tiết, vì trong tiếng Anh các từ nhiều âm tiết thường là các từ phái sinh (derivative) có cấu trúc phức tạp và chứa các phụ tố có nguồn gốc vay mượn, ít phổ biến.
Từ cách lượng hóa nói trên, các nhà giáo dục đã đưa ra khá nhiều công thức tính ‘readability’ như công thức của Fry, Gunning Fox, vv; tuy nhiên cách tính “readability” phổ biến nhất hiện nay sử dụng bộ công thức của Flesch, cũng là bộ công thức có cài đặt sẵn trong phần mềm MS-Word (trong bộ Microsoft Office) có thể sẵn sàng sử dụng. [...]
Bộ công thức Flesch gồm 2 công thức: công thức tính chỉ số Flesch Reading Ease (từ đây sẽ gọi là FRE, tạm dịch ‘chỉ số độ khó của văn bản’) và công thức tính chỉ số Flesch–Kincaid Grade Level Index (còn gọi là Flesch – Kincaid Index; từ đây sẽ gọi là ‘FKI’, tạm dịch là ‘chỉ số Flesch-Kincaid’).
Chỉ số FRE hiện đang được sử dụng rất phổ biến vì nó mô tả khá chính xác đặc điểm tổng quát về ngôn ngữ của một văn bản . FRE đã được chấp nhận như một chuẩn mực quy định văn phong hành chính của văn bản tiếng Anh. Ví dụ, tiểu bang Indiana (Mỹ) có quy định là các chính sách bảo hiểm phải có giá trị tối thiểu là 40, và bộ luật năm 1981 của tiểu bang này còn có hướng dẫn cụ thể cách tính giá trị FRE .
Bên cạnh việc mô tả độ khó của văn bản, bộ công thức Flesch có thể giúp ta tính được trình độ học vấn tương đương của văn bản (tức trình độ tối thiểu mà người đọc cần có để hiểu văn bản) bằng công thức FKI . Từ công thức này, ta có thể chuyển đổi từ chỉ số FRE ra cấp lớp tương đương, thấp nhất là lớp 4 và cao nhất là sau đại học [...].
Sự phổ biến của khái niệm “readability” và ứng dụng của nó trong việc hỗ trợ các giáo viên lựa chọn tài liệu đọc phù hợp cho học sinh bản ngữ (tiếng Anh), cũng như trong việc hướng dẫn các tác giả điều chỉnh văn phong của mình cho phù hợp với độc giả đã gợi ý cho chúng tôi một hướng giải quyết đối với việc đưa ra những tiêu chí khách quan lựa chọn ngữ liệu nền phục vụ viết câu trắc nghiệm phù hợp với các mức trình độ ngôn ngữ khác nhau. Vấn đề còn lại cần giải quyết là xác định các chỉ số độ khó văn bản phù hợp cho từng trình độ.
Để làm điều này, chúng tôi đã kết hợp tìm hiểu những chỉ số đã được sử dụng cho những đối tượng khác nhau, đồng thời thực hiện kiểm tra thực nghiệm một số văn bản đã thu thập được trước khi đưa ra những gợi ý về các chỉ số nói trên. Quá trình và kết quả thực nghiệm độ khó của văn bản sẽ được trình bày [...] dưới đây.
Xác định các chỉ số phù hợp cho các trình độ và thực nghiệm các chỉ số đã xác định trên một số văn bản mẫu để kiểm chứng
[...]Như đã nêu [...], khái niệm “readability” và chỉ số FRE đã được sử dụng rộng rãi đối với các văn bản tiếng Anh nhằm hướng dẫn các tác giả viết các văn bản phù hợp với đối tượng độc giả mà mình nhắm đến. Ngoài quy định của tiểu bang Indiana với FRE tối thiểu là 40 (trình độ đại học) như đã được nêu ở trên, từ điển bách khoa mở Wikipedia còn nêu một số kết quả thực nghiệm các chỉ số Flesch trên các loại văn bản viết cho những đối tượng độc giả khác nhau như sau:
- Tạp chí Reader’s Digest: chỉ số FRE trung bình là 65; đây là một tạp chí phổ biến các kiến thức phổ thông nhằm phục vụ đối tượng độc giả đại trà. Do tính phổ thông và đa dạng về nội dung cũng như tính dễ đọc của văn phong ngôn ngữ, tạp chí này cũng rất thường được sử dụng làm tư liệu phục vụ việc giảng dạy ngoại ngữ ở trình độ cơ bản trở lên.
- Tạp chí Time: chỉ số FRE trung bình là 52; đây là một tạp chí được viết cho đối tượng độc giả bản ngữ nghiêm túc và có trình độ. Để đọc được tạp chí này, người đọc không phải là người bản ngữ phải có trình độ ngoại ngữ tối thiểu ở mức trung cấp.
- Tạp chí Havard Law Review: chỉ số FRE trung bình khoảng từ 30 đến dưới 35. Đây là tạp chí chuyên ngành phục vụ chủ yếu cho những người hoạt động trong ngành luật. Để đọc tạp chí này, người đọc không phải là người bản ngữ phải có kiến thức về chuyên ngành và trình độ ngoại ngữ tối thiểu ở mức nâng cao.
Cũng theo Wikipedia, đa số các bang yêu cầu các hợp đồng bảo hiểm phải được viết với chỉ số FRE trong khoảng từ 40-50 để đảm bảo sự dễ đọc cho các khách hàng mua bảo hiểm khi ký hợp đồng. Khi quan sát những chỉ số thực tế này, ta sẽ thấy khoảng cách giữa các trình độ có giá trị khoảng trên dưới 15 điểm FRE, trong đó mức 65 điểm FRE là mức thấp nhất đối với một độc giả bản ngữ trưởng thành (vd: mức FRE 65 của Reader’s Digest, mức FRE 52 của Time, và mức FRE ngoài 30 của Havard Law Review).
Dựa trên quan sát đó, và chiếu theo bản mô tả 6 mức trình độ ngoại ngữ của Khung trình độ chung châu Âu (Common European Framework, viết tắt là CEF) là A1 (tiền sơ cấp), A2 (sơ cấp), B1 (sơ trung cấp), B2 (trung cấp), C1 (cao trung cấp), và C2 (cao cấp), chúng tôi đã xây dựng hệ tiêu chí về độ khó của ngữ liệu nền cho các mức trình độ tiếng Anh như sau:
0-20 Cao cấp, (C2) tương đương IELTS 8.0 trở lên (Sau đại học)
21-35 Nâng cao (C1), tương đương IELTS 7.0 trở lên (Đại học)
36-50 Trung cấp (B2), tương đương IELTS 6.0 trở lên (Trung học phổ thông)
51-65 Sơ trung cấp (B1), trình độ bắt đầu sử dụng độc lập của người học tiếng Anh, tương đương IELTS 5.0 trở lên (Lớp 8 – 9)
66-80 Sơ cấp (A2), tương đương IELTS 4.0 trở lên (Lớp 7)
81-100 Tiền sơ cấp (A1), trình độ ngoại ngữ vỡ lòng, tương đương IELTS từ 3.0 trở xuống (Lớp 4 – 6)
Trong quá trình xây dựng các tiêu chí về độ khó của văn bản, chúng tôi đã thực hiện thu thập ý kiến các đồng nghiệp về trình độ cần có của người đọc để có thể hiểu một số văn bản mẫu, sau đó kiểm chứng lại độ khó của các văn bản này xem có phù hợp với các mức đã đưa ra hay không. Dưới đây là những kết quả kiểm chứng:
- Mẫu văn bản đầu tiên được rút ngẫu nhiên từ kho ngữ liệu của VOA Special English. Các văn bản này được viết cho đối tượng độc giả đang học tiếng Anh, và được các đồng nghiệp của chúng tôi đánh giá là cần có trình độ ở trình độ sơ trung cấp (B1) trở lên để có thể hiểu chúng (xem Bảng 2.5). Việc kiểm chứng cho ta các kết quả sau:
o Kích thước ngữ liệu mẫu: 19.536 từ
o Độ dài trung bình của câu: 11.0
o Độ dài trung bình của từ: 4.6
o FRE và FKI: 60.2 và 7.6
- Mẫu văn bản thứ hai là một số bài viết về chủ đề môi trường trên trang web http://www.ace.mmu.ac.uk/eae/english.html. Trang web này nhằm phục vụ đối tượng độc giả phổ thông người bản ngữ, và được đánh giá là đòi hỏi trình độ nâng cao (xem Bảng 2.5). Kết quả kiểm chứng như sau:
o Kích thước ngữ liệu mẫu: 6.918 từ
o Độ dài trung bình của câu: 20.6
o Độ dài trung bình của từ: 5.1
o FRE và FKI: 31.4 và 12.0
- Kết quả thực nghiệm trên mẫu văn bản thứ ba bao gồm những bài viết về chủ đề môi trường trên trang web http://www.ace.mmu.ac.uk/kids/, là phiên bản dành cho trẻ em từ 5 đến 11 tuổi của trang web vừa nêu ở phần trên. Các văn bản này được đánh giá là khá dễ đọc, chỉ đòi hỏi trình độ cơ bản (xem Bảng 2.5). Dưới đây là kết quả kiểm chứng:
o Kích thước ngữ liệu mẫu: 4.986 từ
o Độ dài trung bình của câu: 14.9
o Độ dài trung bình của từ: 4.4
o FRE và FKI: 65.7 và 7.7
Có thể thấy các tiêu chí về độ khó mà chúng tôi đã đưa ra đều phù hợp với nhận xét của các đồng nghiệp cũng như kết quả kiểm chứng, chứng tỏ chúng hoàn toàn có thể sử dụng làm cơ sở chọn ngữ liệu nền phục vụ biên soạn câu trắc nghiệm.
Thế là tôi cố gắng đi tìm lại những gì mình đã làm, đã viết, và tìm thấy bản mềm của Báo cáo nghiệm thu đề tài “Tiến đến tự động hóa quy trình soạn đề thi TN tiếng Anh” (2006) đã nghiệm thu thành công (đạt loại xuất sắc, hic). Để làm đề tài này tôi có đặt viết phần mềm, gọi là phần mềm ETGA (EnglishTest Generating Assistant), có lẽ bây giờ đã cũ về công nghệ (thì nghiệm thu đã 5 năm rồi, mà bắt đầu làm thì trước đó đến 2, 3 nên tổng cộng cũng phải gần chục năm rồi). Nhưng những ý tưởng của đề tài thì vẫn còn mới, và cho đến nay cũng chưa thấy áp dụng ở VN (buồn thật). Hình như ngành học của tôi không có cơ hội sống sót ở VN hay sao ấy nhỉ, ngày xưa thì có cụ Dương Thiệu Tống theo đuổi mãi, giờ hình như chỉ còn một mình tôi hay sao ấy, độc cô cầu bại (!). Chán thế.
Thôi thì đằng nào đề tài cũng xong rồi, nay đưa dần một số ý tưởng dễ hiểu, dễ nuốt trôi lên đây để chia sẻ với những người có quan tâm vậy. Hy vọng cũng có lúc có nhiều người hiểu và ứng dụng khoa học trắc nghiệm vào trong giáo dục, để mong rằng có thể góp tay nâng cao chất lượng của giáo dục VN lên đôi chút.
Entry này xin trích phần dễ hiểu và dễ áp dụng nhất đối với các giáo viên tiếng Anh và giáo viên ngoại ngữ nói chung, là phần nói về Readability mà tôi đã tạm dịch là “độ khó của văn bản” trong một bài viết từ năm 2002 ở trường ĐH KHXH-NV hồi ấy (đúng một chục năm rồi đó, mà ý tưởng này vẫn chưa được áp dụng, dù nó thật dễ làm sao!).
Thế này mà ở VN đòi tất cả mọi giảng viên phải làm nghiên cứu khoa học và ứng dụng được, thu tiền được, thì ở đâu ra? Hãy cứ dùng cái có sẵn cho đến nơi đến chốn, cũng đã mệt mỏi lắm rồi. Ví dụ như khoa học trắc nghiệm, ở nước người ta đã hơn 100 năm tuổi rồi, còn mình thì bây giờ vẫn còn cãi nhau về điểm sàn, thi cử vẫn cứ điểm thô mà phang, mà đưa ra mọi loại quyết định quan trọng đến vận mệnh học sinh, thì ôi thôi…
Biết rồi, khổ lắm, nói mãi!
Chú thích: Tựa nhỏ trong entry là những đề mục trong đề tài, bị cắt đứt đoạn nên có thể hơi khó đọc một chút. Ai có thắc mắc hoặc hứng thú xin gửi thư hỏi tác giả vtpanh@gmail.com.
-------
Xác định độ khó của văn bản và việc lựa chọn ngữ liệu cho các cho các bài kiểm tra ngôn ngữ
[...] Cho đến nay, việc chọn ngữ liệu để soạn thảo câu hỏi nghiệm hoàn toàn phụ thuộc vào người viết câu trắc nghiệm mà không có những tiêu chí thống nhất để đảm bảo rằng độ khó giữa các ngữ liệu nền được cung cấp trong các bài trắc nghiệm ở trình độ tương đương là thực sự tương đương. Tất nhiên, việc đưa ra một công thức chung để áp dụng cho mọi đối tượng ở mọi trình độ là điều không khả thi mà cũng không cần thiết vì mục tiêu kiểm tra đánh giá, trình độ và đặc điểm của đối tượng thí sinh của mỗi kỳ thi là khác nhau. Vì thế, vai trò của người làm đề thi với những kinh nghiệm và phán đoán của họ trong việc lựa chọn ngữ liệu phù hợp vẫn luôn luôn cần thiết và không thể thay thế. Tuy nhiên, thay vì hoàn toàn phụ thuộc vào phán đoán của từng người ra đề theo sử dụng phương pháp thủ công (tức mỗi người ra đề sẽ phải vừa đọc tư liệu và phán đoán sự phù hợp của từng đoạn ngữ liệu đối với mục đích kiểm tra), rất cần có những tiêu chí khách quan, đơn giản dễ sử dụng để hỗ trợ người viết câu trắc nghiệm trong việc lựa chọn ngữ liệu, vừa tăng hiệu quả sử dụng thời gian lại vừa đảm bảo giá trị của các câu trắc nghiệm do nhiều tác giả khác nhau biên soạn.
Một trong những yêu cầu hàng đầu của việc chọn ngữ liệu nền phục vụ biên soạn câu hỏi trắc nghiệm cho mọi môn học là ngôn ngữ phải rõ ràng, dễ hiểu và phù hợp với mức trình độ của thí sinh. Đối với môn ngoại ngữ, yêu cầu này lại càng quan trọng, nhưng chưa được chú ý đầy đủ trong các bài trắc nghiệm tiếng Anh được các chuyên gia trong nước soạn ra. Trong một nghiên cứu vào năm 2002 , chúng tôi đã nêu ra khá nhiều ví dụ về những câu trắc nghiệm có ngữ liệu nền quá khó đối với thí sinh khiến thí sinh không trả lời được câu hỏi, mặc dù vấn đề đang được kiểm tra hoàn toàn nằm trong nội dung chương trình cũng như năng lực của thí sinh. Vì vậy, để tăng tính khách quan của việc phán đoán sự phù hợp của ngữ liệu nền, chúng tôi đề nghị áp dụng công thức tính độ khó của văn bản tiếng Anh theo công thức Flesch (được tích hợp sẵn trong phần mềm MS-Word trên Windows) để giải quyết vấn đề này. [...].
Khái niệm độ khó của văn bản và việc lựa chọn ngữ liệu phù hợp với người đọc
Độ khó của văn bản là một khái niệm đã được đưa ra tại Mỹ từ những thập niên 30-40 của thế kỷ trước để giải quyết một vấn đề thực tiễn trong giáo dục là lựa chọn các loại sách đọc thêm phù hợp với trình độ ngôn ngữ của trẻ em, khuyến khích trẻ em yêu thích việc đọc sách và thúc đẩy phát triển khả năng ngôn ngữ. Bất cứ ai cũng có thể dễ dàng nhận ra rằng có những cuốn sách viết dễ đọc và có cuốn khác viết khó đọc hơn rất nhiều.
Điều gì đã tạo nên sự dễ đọc trong phong cách viết của các tác giả khác nhau? Từ lâu, các nhà nghiên cứu ngôn ngữ đã xác định được hai yếu tố chính có ảnh hưởng đến độ khó của văn bản là ý nghĩa và kết cấu ngữ pháp, được thể hiện qua hai đơn vị ngôn ngữ là từ (đơn vị chuyên chở nghĩa) và câu (đơn vị thể hiện kết cấu ngữ pháp), và đưa ra những phương pháp để lượng hóa 2 yếu tố này để làm cơ sở quyết định sự phù hợp của ngữ liệu đối với người đọc. Kết quả của việc lượng hóa hai yếu tố của độ khó của văn bản đã cho ra đời khái niệm “readability” mà chúng tôi tạm dịch là độ khó của văn bản (dịch sát nghĩa tiếng Anh là “tính dễ đọc” của văn bản).
Độ khó của văn bản được lượng hóa bằng một công thức tính khá đơn giản. Như đã nói ở trên, độ khó của văn bản phụ thuộc chủ yếu vào ý nghĩa của từ và cấu trúc của câu trong văn bản. Từ ngữ nào càng được sử dụng phổ biến thì càng nhiều người biết, tức càng dễ hiểu; và cấu trúc câu càng đơn giản, ít phức tạp, rối rắm thì càng rõ ràng, dễ đọc. Dựa trên những quan sát trên, các nhà giáo dục đã đưa ra phương pháp lượng hóa độ phức tạp của kết cấu ngữ pháp của văn bản bằng cách đo độ dài trung bình của câu theo đơn vị từ; cũng vậy, tính phổ biến của từ được lượng hóa bằng độ dài của từ tính theo âm tiết, vì trong tiếng Anh các từ nhiều âm tiết thường là các từ phái sinh (derivative) có cấu trúc phức tạp và chứa các phụ tố có nguồn gốc vay mượn, ít phổ biến.
Từ cách lượng hóa nói trên, các nhà giáo dục đã đưa ra khá nhiều công thức tính ‘readability’ như công thức của Fry, Gunning Fox, vv; tuy nhiên cách tính “readability” phổ biến nhất hiện nay sử dụng bộ công thức của Flesch, cũng là bộ công thức có cài đặt sẵn trong phần mềm MS-Word (trong bộ Microsoft Office) có thể sẵn sàng sử dụng. [...]
Bộ công thức Flesch gồm 2 công thức: công thức tính chỉ số Flesch Reading Ease (từ đây sẽ gọi là FRE, tạm dịch ‘chỉ số độ khó của văn bản’) và công thức tính chỉ số Flesch–Kincaid Grade Level Index (còn gọi là Flesch – Kincaid Index; từ đây sẽ gọi là ‘FKI’, tạm dịch là ‘chỉ số Flesch-Kincaid’).
Chỉ số FRE hiện đang được sử dụng rất phổ biến vì nó mô tả khá chính xác đặc điểm tổng quát về ngôn ngữ của một văn bản . FRE đã được chấp nhận như một chuẩn mực quy định văn phong hành chính của văn bản tiếng Anh. Ví dụ, tiểu bang Indiana (Mỹ) có quy định là các chính sách bảo hiểm phải có giá trị tối thiểu là 40, và bộ luật năm 1981 của tiểu bang này còn có hướng dẫn cụ thể cách tính giá trị FRE .
Bên cạnh việc mô tả độ khó của văn bản, bộ công thức Flesch có thể giúp ta tính được trình độ học vấn tương đương của văn bản (tức trình độ tối thiểu mà người đọc cần có để hiểu văn bản) bằng công thức FKI . Từ công thức này, ta có thể chuyển đổi từ chỉ số FRE ra cấp lớp tương đương, thấp nhất là lớp 4 và cao nhất là sau đại học [...].
Sự phổ biến của khái niệm “readability” và ứng dụng của nó trong việc hỗ trợ các giáo viên lựa chọn tài liệu đọc phù hợp cho học sinh bản ngữ (tiếng Anh), cũng như trong việc hướng dẫn các tác giả điều chỉnh văn phong của mình cho phù hợp với độc giả đã gợi ý cho chúng tôi một hướng giải quyết đối với việc đưa ra những tiêu chí khách quan lựa chọn ngữ liệu nền phục vụ viết câu trắc nghiệm phù hợp với các mức trình độ ngôn ngữ khác nhau. Vấn đề còn lại cần giải quyết là xác định các chỉ số độ khó văn bản phù hợp cho từng trình độ.
Để làm điều này, chúng tôi đã kết hợp tìm hiểu những chỉ số đã được sử dụng cho những đối tượng khác nhau, đồng thời thực hiện kiểm tra thực nghiệm một số văn bản đã thu thập được trước khi đưa ra những gợi ý về các chỉ số nói trên. Quá trình và kết quả thực nghiệm độ khó của văn bản sẽ được trình bày [...] dưới đây.
Xác định các chỉ số phù hợp cho các trình độ và thực nghiệm các chỉ số đã xác định trên một số văn bản mẫu để kiểm chứng
[...]Như đã nêu [...], khái niệm “readability” và chỉ số FRE đã được sử dụng rộng rãi đối với các văn bản tiếng Anh nhằm hướng dẫn các tác giả viết các văn bản phù hợp với đối tượng độc giả mà mình nhắm đến. Ngoài quy định của tiểu bang Indiana với FRE tối thiểu là 40 (trình độ đại học) như đã được nêu ở trên, từ điển bách khoa mở Wikipedia còn nêu một số kết quả thực nghiệm các chỉ số Flesch trên các loại văn bản viết cho những đối tượng độc giả khác nhau như sau:
- Tạp chí Reader’s Digest: chỉ số FRE trung bình là 65; đây là một tạp chí phổ biến các kiến thức phổ thông nhằm phục vụ đối tượng độc giả đại trà. Do tính phổ thông và đa dạng về nội dung cũng như tính dễ đọc của văn phong ngôn ngữ, tạp chí này cũng rất thường được sử dụng làm tư liệu phục vụ việc giảng dạy ngoại ngữ ở trình độ cơ bản trở lên.
- Tạp chí Time: chỉ số FRE trung bình là 52; đây là một tạp chí được viết cho đối tượng độc giả bản ngữ nghiêm túc và có trình độ. Để đọc được tạp chí này, người đọc không phải là người bản ngữ phải có trình độ ngoại ngữ tối thiểu ở mức trung cấp.
- Tạp chí Havard Law Review: chỉ số FRE trung bình khoảng từ 30 đến dưới 35. Đây là tạp chí chuyên ngành phục vụ chủ yếu cho những người hoạt động trong ngành luật. Để đọc tạp chí này, người đọc không phải là người bản ngữ phải có kiến thức về chuyên ngành và trình độ ngoại ngữ tối thiểu ở mức nâng cao.
Cũng theo Wikipedia, đa số các bang yêu cầu các hợp đồng bảo hiểm phải được viết với chỉ số FRE trong khoảng từ 40-50 để đảm bảo sự dễ đọc cho các khách hàng mua bảo hiểm khi ký hợp đồng. Khi quan sát những chỉ số thực tế này, ta sẽ thấy khoảng cách giữa các trình độ có giá trị khoảng trên dưới 15 điểm FRE, trong đó mức 65 điểm FRE là mức thấp nhất đối với một độc giả bản ngữ trưởng thành (vd: mức FRE 65 của Reader’s Digest, mức FRE 52 của Time, và mức FRE ngoài 30 của Havard Law Review).
Dựa trên quan sát đó, và chiếu theo bản mô tả 6 mức trình độ ngoại ngữ của Khung trình độ chung châu Âu (Common European Framework, viết tắt là CEF) là A1 (tiền sơ cấp), A2 (sơ cấp), B1 (sơ trung cấp), B2 (trung cấp), C1 (cao trung cấp), và C2 (cao cấp), chúng tôi đã xây dựng hệ tiêu chí về độ khó của ngữ liệu nền cho các mức trình độ tiếng Anh như sau:
0-20 Cao cấp, (C2) tương đương IELTS 8.0 trở lên (Sau đại học)
21-35 Nâng cao (C1), tương đương IELTS 7.0 trở lên (Đại học)
36-50 Trung cấp (B2), tương đương IELTS 6.0 trở lên (Trung học phổ thông)
51-65 Sơ trung cấp (B1), trình độ bắt đầu sử dụng độc lập của người học tiếng Anh, tương đương IELTS 5.0 trở lên (Lớp 8 – 9)
66-80 Sơ cấp (A2), tương đương IELTS 4.0 trở lên (Lớp 7)
81-100 Tiền sơ cấp (A1), trình độ ngoại ngữ vỡ lòng, tương đương IELTS từ 3.0 trở xuống (Lớp 4 – 6)
Trong quá trình xây dựng các tiêu chí về độ khó của văn bản, chúng tôi đã thực hiện thu thập ý kiến các đồng nghiệp về trình độ cần có của người đọc để có thể hiểu một số văn bản mẫu, sau đó kiểm chứng lại độ khó của các văn bản này xem có phù hợp với các mức đã đưa ra hay không. Dưới đây là những kết quả kiểm chứng:
- Mẫu văn bản đầu tiên được rút ngẫu nhiên từ kho ngữ liệu của VOA Special English. Các văn bản này được viết cho đối tượng độc giả đang học tiếng Anh, và được các đồng nghiệp của chúng tôi đánh giá là cần có trình độ ở trình độ sơ trung cấp (B1) trở lên để có thể hiểu chúng (xem Bảng 2.5). Việc kiểm chứng cho ta các kết quả sau:
o Kích thước ngữ liệu mẫu: 19.536 từ
o Độ dài trung bình của câu: 11.0
o Độ dài trung bình của từ: 4.6
o FRE và FKI: 60.2 và 7.6
- Mẫu văn bản thứ hai là một số bài viết về chủ đề môi trường trên trang web http://www.ace.mmu.ac.uk/eae/english.html. Trang web này nhằm phục vụ đối tượng độc giả phổ thông người bản ngữ, và được đánh giá là đòi hỏi trình độ nâng cao (xem Bảng 2.5). Kết quả kiểm chứng như sau:
o Kích thước ngữ liệu mẫu: 6.918 từ
o Độ dài trung bình của câu: 20.6
o Độ dài trung bình của từ: 5.1
o FRE và FKI: 31.4 và 12.0
- Kết quả thực nghiệm trên mẫu văn bản thứ ba bao gồm những bài viết về chủ đề môi trường trên trang web http://www.ace.mmu.ac.uk/kids/, là phiên bản dành cho trẻ em từ 5 đến 11 tuổi của trang web vừa nêu ở phần trên. Các văn bản này được đánh giá là khá dễ đọc, chỉ đòi hỏi trình độ cơ bản (xem Bảng 2.5). Dưới đây là kết quả kiểm chứng:
o Kích thước ngữ liệu mẫu: 4.986 từ
o Độ dài trung bình của câu: 14.9
o Độ dài trung bình của từ: 4.4
o FRE và FKI: 65.7 và 7.7
Có thể thấy các tiêu chí về độ khó mà chúng tôi đã đưa ra đều phù hợp với nhận xét của các đồng nghiệp cũng như kết quả kiểm chứng, chứng tỏ chúng hoàn toàn có thể sử dụng làm cơ sở chọn ngữ liệu nền phục vụ biên soạn câu trắc nghiệm.
Wednesday, October 5, 2011
Xây dựng ngân hàng ... (3): Tạo “nhóm chuẩn” và xây dựng “điểm tiêu chuẩn” của bài trắc nghiệm như thế nào?
Một ngân hàng câu hỏi trắc nghiệm chuẩn hóa (standardized) đòi hỏi mỗi câu hỏi trắc nghiệm phải có các thông số cần thiết, ví dụ như độ khó (độ dễ), độ phân cách, và chỉ số B (đã được đề cập trong bài trước). Nhưng làm sao có được những thông số này?
Trong lý thuyết trắc nghiệm cổ điển (CTT), việc “chuẩn hóa” các câu hỏi bắt đầu bằng việc chọn một “nhóm chuẩn”, tức norm group trong tiếng Anh. “Nhóm chuẩn” ở đây được hiểu là nhóm đại diện tiêu biểu cho những thí sinh là đối tượng của bài trắc nghiệm, và kết quả thực hiện (performance) các câu hỏi trắc nghiệm của họ được sử dụng để tính toán các thông số cần thiết cho từng câu hỏi. Kết quả này gọi là “norm”, tức “chuẩn mực” của bài trắc nghiệm (không phải theo nghĩa “tiêu chuẩn” mà mọi người phải phấn đấu làm theo, mà hiểu theo nghĩa xã hội học, tức một hành vi nào đó mà đa số đều làm).
Dưới đây là phần định nghĩa và thảo luận về khái niệm “chuẩn mực” của các tác giả trước đây, được trích lại trong bài của Rodríguez (1997):
Quá trình tạo nhóm chuẩn và xây dựng “norm” cho một bài trắc nghiệm được Rodriguez gọi là “norming”, tạm dịch là “xây dựng chuẩn”. Một số tác giả khác gọi quá trình này là standardization, tức tiêu chuẩn hóa, với cùng nghĩa như “norming” ở trên. Rodriguez giới thiệu quy trình “xây dựng chuẩn” gồm 9 bước do Crocker và Algina đưa ra năm 1986 mà ta có thể tóm tắt thành 4 bước như sau:
1. Xác định tổng thể có liên quan và các số thống kê cần có.
2. Xác định sai số chọn mẫu và ước lượng kích thước mẫu.
3. Thiết lập một quy trình chọn mẫu từ tổng thể, thực hiện việc chọn mẫu và thu thập dữ liệu, sau đó tính toán các giá trị số thống kê của nhóm có liên quan và sai số chuẩn.
4. Xác định loại “điểm tiêu chuẩn” sẽ sử dụng và xây dựng bảng quy đổi từ điểm thô sang “điểm tiêu chuẩn”.
Trong 4 bước vừa nêu, 3 bước đầu hoàn toàn liên quan đến việc chọn mẫu mà bất kỳ cuốn sách dạy thống kê căn bản trong giáo dục hoặc xã hội học đều có đề cập kỹ lưỡng. Riêng bước số 4 có liên quan đến việc xây dựng ngân hàng câu hỏi trắc nghiệm chuẩn hóa (standardized test), và sẽ được thảo luận kỹ hơn trong phần dưới đây.
Trước hết, cần giải thích khái niệm “điểm tiêu chuẩn” (tiếng Anh là standard scores, standardized scores hoặc normative scores). Điểm tiêu chuẩn là một loại điểm quy đổi (derived hoặc converted) dựa trên khái niệm phân bố chuẩn trong thống kê, trong đó mỗi điểm số có thể được diễn giải như một vị trí trên phân bố điểm số và cho phép ta biết được vị trí tương đối của nó khi so sánh với điểm số của những cá nhân khác. Để biểu thị vị trí này, người ta dùng độ lệch chuẩn làm đơn vị tính cho từng điểm số.
Có nhiều loại điểm tiêu chuẩn khác nhau, nhưng tất cả đều quy đổi từ loại điểm tiêu chuẩn gốc gọi là điểm z. Theo Brown (2005:123) z score là số đo trực tiếp khoảng cách từ một điểm số đến điểm trung bình, tính bằng đơn vị độ lệch chuẩn. Điểm z có trung bình bằng 0 và độ lệch chuẩn là 1. Thang điểm này có 3 độ lệch chuẩn ở mỗi bên của điểm trung bình với các giá trị là -3, -2, -1, 0, 1, 2, 3.
Muốn quy đổi từ điểm thô sang điểm tiêu chuẩn đã chọn, trước hết cần phải biết được trung bình và độ lệch chuẩn trong phân bố điểm của nhóm chuẩn (là nhóm đã được xác lập ở trên). Sau đó, áp dụng các công thức quy đổi sang loại điểm tiêu chuẩn đã chọn.
Công thức quy đổi từ điểm thô sang điểm z như sau:
z = (x-M)/s
trong đó x là điểm thô, M là điểm trung bình, và s là độ lệch chuẩn (tính theo điểm số của nhóm chuẩn đã chọn).
(còn tiếp)
Links:
1. http://ericae.net/ft/tamu/Norm.htm
2. http://web.sau.edu/WaterStreetMaryA/NEW%20intro%20to%20tests%20&%20measures%20website_files/norms_and_the_meaning_of_test__s.htm
Trong lý thuyết trắc nghiệm cổ điển (CTT), việc “chuẩn hóa” các câu hỏi bắt đầu bằng việc chọn một “nhóm chuẩn”, tức norm group trong tiếng Anh. “Nhóm chuẩn” ở đây được hiểu là nhóm đại diện tiêu biểu cho những thí sinh là đối tượng của bài trắc nghiệm, và kết quả thực hiện (performance) các câu hỏi trắc nghiệm của họ được sử dụng để tính toán các thông số cần thiết cho từng câu hỏi. Kết quả này gọi là “norm”, tức “chuẩn mực” của bài trắc nghiệm (không phải theo nghĩa “tiêu chuẩn” mà mọi người phải phấn đấu làm theo, mà hiểu theo nghĩa xã hội học, tức một hành vi nào đó mà đa số đều làm).
Dưới đây là phần định nghĩa và thảo luận về khái niệm “chuẩn mực” của các tác giả trước đây, được trích lại trong bài của Rodríguez (1997):
Norms are statistics that describe the test performance of a defined group of pupils (Noll, Scannell & Craig, 1979). As Brown (1976) noted, potentially there are a number of possible norm groups for any test. Since a person's relative ranking may vary widely, depending upon the norm group used for comparison, Brown claimed that the composition of the norm group is a crucial factor in the interpretation of norm-referenced scores.
"Chuẩn mực" là những số thống kê nhằm mô tả kết quả thực hiện bài trắc nghiệm của một nhóm người học được xác định trước (Noll, Scannell & Craig 1979). Theo Brown (1976), mỗi bài trắc nghiệm có thể có nhiều nhóm chuẩn tiềm năng. Vì thứ hạng tương đối của mỗi cá nhân đều có mức độ dao động rất lớn, phụ thuộc vào nhóm chuẩn được sử dụng để so sánh, nên Brown cho rằng cấu trúc của nhóm chuẩn là yếu tố then chốt trong việc diễn giải điểm số của các bài “trắc nghiệm chuẩn mực” NRT (hoặc, theo cách gọi của tôi, trắc nghiệm quy chiếu nhóm chuẩn).
Quá trình tạo nhóm chuẩn và xây dựng “norm” cho một bài trắc nghiệm được Rodriguez gọi là “norming”, tạm dịch là “xây dựng chuẩn”. Một số tác giả khác gọi quá trình này là standardization, tức tiêu chuẩn hóa, với cùng nghĩa như “norming” ở trên. Rodriguez giới thiệu quy trình “xây dựng chuẩn” gồm 9 bước do Crocker và Algina đưa ra năm 1986 mà ta có thể tóm tắt thành 4 bước như sau:
1. Xác định tổng thể có liên quan và các số thống kê cần có.
2. Xác định sai số chọn mẫu và ước lượng kích thước mẫu.
3. Thiết lập một quy trình chọn mẫu từ tổng thể, thực hiện việc chọn mẫu và thu thập dữ liệu, sau đó tính toán các giá trị số thống kê của nhóm có liên quan và sai số chuẩn.
4. Xác định loại “điểm tiêu chuẩn” sẽ sử dụng và xây dựng bảng quy đổi từ điểm thô sang “điểm tiêu chuẩn”.
Trong 4 bước vừa nêu, 3 bước đầu hoàn toàn liên quan đến việc chọn mẫu mà bất kỳ cuốn sách dạy thống kê căn bản trong giáo dục hoặc xã hội học đều có đề cập kỹ lưỡng. Riêng bước số 4 có liên quan đến việc xây dựng ngân hàng câu hỏi trắc nghiệm chuẩn hóa (standardized test), và sẽ được thảo luận kỹ hơn trong phần dưới đây.
Trước hết, cần giải thích khái niệm “điểm tiêu chuẩn” (tiếng Anh là standard scores, standardized scores hoặc normative scores). Điểm tiêu chuẩn là một loại điểm quy đổi (derived hoặc converted) dựa trên khái niệm phân bố chuẩn trong thống kê, trong đó mỗi điểm số có thể được diễn giải như một vị trí trên phân bố điểm số và cho phép ta biết được vị trí tương đối của nó khi so sánh với điểm số của những cá nhân khác. Để biểu thị vị trí này, người ta dùng độ lệch chuẩn làm đơn vị tính cho từng điểm số.
Có nhiều loại điểm tiêu chuẩn khác nhau, nhưng tất cả đều quy đổi từ loại điểm tiêu chuẩn gốc gọi là điểm z. Theo Brown (2005:123) z score là số đo trực tiếp khoảng cách từ một điểm số đến điểm trung bình, tính bằng đơn vị độ lệch chuẩn. Điểm z có trung bình bằng 0 và độ lệch chuẩn là 1. Thang điểm này có 3 độ lệch chuẩn ở mỗi bên của điểm trung bình với các giá trị là -3, -2, -1, 0, 1, 2, 3.
Muốn quy đổi từ điểm thô sang điểm tiêu chuẩn đã chọn, trước hết cần phải biết được trung bình và độ lệch chuẩn trong phân bố điểm của nhóm chuẩn (là nhóm đã được xác lập ở trên). Sau đó, áp dụng các công thức quy đổi sang loại điểm tiêu chuẩn đã chọn.
Công thức quy đổi từ điểm thô sang điểm z như sau:
z = (x-M)/s
trong đó x là điểm thô, M là điểm trung bình, và s là độ lệch chuẩn (tính theo điểm số của nhóm chuẩn đã chọn).
(còn tiếp)
Links:
1. http://ericae.net/ft/tamu/Norm.htm
2. http://web.sau.edu/WaterStreetMaryA/NEW%20intro%20to%20tests%20&%20measures%20website_files/norms_and_the_meaning_of_test__s.htm
Tuesday, October 4, 2011
Xây dựng ngân hàng câu hỏi trắc nghiệm (2): Những thông số cần có trong ngân hàng câu hỏi
Một ngân hàng câu hỏi trắc nghiệm theo nghĩa rộng nhất có thể chỉ đơn thuần là một tập hợp các câu hỏi được lưu giữ và sắp xếp để thuận tiện cho việc sử dụng. Theo nghĩa này, thì một ngân hàng câu hỏi thậm chí có thể là bản cứng (trên giấy), chứ không cần có một cơ sở dữ liệu điện tử. Nhưng ngày nay, với sự hỗ trợ mạnh mẽ của máy tính, để được xem là một ngân hàng câu hỏi thì bắt buộc mỗi câu hỏi này còn phải kèm theo những thông số kỹ thuật nữa. Theo lý thuyết trắc nghiệm cổ điển CTT, những thông số đó gồm có: độ khó, độ phân biệt, và chỉ số B.
1. Độ khó
Thông số cơ bản, cũng là điều tối thiểu một ngân hàng câu hỏi phải có, là độ khó/độ dễ của câu hỏi, tiếng Anh gọi là item facility, ký hiệu là IF (ngày xưa gọi là item difficulty). Độ khó này không phải là phán đoán chủ quan của người ra đề (mặc dù đây cũng là một loại thông tin cần thiết trong ngân hàng, nếu có), mà là một con số có được từ thực tế sử dụng (ngôn ngữ của thống kê là “dữ liệu thực nghiệm” – empirical data), tức kết quả kiểm tra của người học trên từng câu (khoa học trắc nghiệm gọi là “dữ liệu đáp ứng” – response data).
Tính độ khó của một câu hỏi trắc nghiệm vô cùng đơn giản, vì nó chỉ là một bài toán chia: lấy số người làm đúng chia cho tổng số người làm. Giá trị của nó là từ 0 (không có ai làm đúng) đến 1 (tất cả mọi người đều làm đúng), nhưng thông thường hai trường hợp này rất hiếm khi xảy ra. Độ khó lý tưởng của một câu trắc nghiệm thì tùy thuộc vào mục đích của người sử dụng, nhưng thông thường người ta thích dùng những câu từ 0.3 (tương đối khó) đến 0.7 (tương đối dễ). Đôi khi có thể nới rộng phạm vi ra từ 0.2 đến 0.9, nhưng ít khi vượt quá mức này, vì lúc ấy chúng trở nên quá khó hoặc quá dễ, và điều này sẽ ảnh hưởng đến độ phân biệt của câu hỏi trắc nghiệm. (Độ phân biệt là một thông số khác, sẽ được đề cập ở phần sau của entry này).
2. Độ phân biệt
Là một thông số quan trọng khác của câu hỏi trắc nghiệm, và cũng rất đơn giản cả về khái niệm lẫn về tính toán. Tiếng Anh gọi độ phân biệt (có người gọi là độ phân cách) là item discrimination, ký hiệu là ID. Đây là một chỉ số đo khả năng phân biệt giữa người làm giỏi và người làm kém của từng câu trắc nghiệm, được tính bằng trung bình điểm từng câu trắc nghiệm của nhóm giỏi trừ trung bình điểm của nhóm kém.
Giá trị của độ phân biệt dao động từ -1 (tất cả mọi người giỏi đều làm sai, điểm trung bình là 0, trong khi tất cả mọi người kém đều làm đúng, điểm trung bình là 1) đến 1 (tình trạng ngược lại). Độ phân biệt được xem là tốt nếu nó có giá trị từ 0.3 trở lên, và tất nhiên là càng cao thì càng tốt. Tuyệt đối trong đề thi không được có câu có độ phân biệt âm (vậy mà trên thực tế thi cử của VN thì vẫn có đấy các bạn ạ, vì thỉnh thoảng tôi vẫn có cơ hội để phân tích số liệu thi cử mà).
Người ta lấy điểm tổng của một bài thi có nhiều câu để làm căn cứ xác định nhóm giỏi và nhóm kém. Tất cả thí sinh được sắp xếp theo thứ tự điểm tổng, và nhóm giỏi được xác định là 1/3 (tức 33%) số thí sinh có điểm cao nhất, còn nhóm kém là 1/3 có điểm thấp nhất. Tuy nhiên, tùy theo tình hình thực tế, người ta cũng có thể lấy một tỷ lệ thấp hơn 33% nhưng không dưới 25% để có được một giá trị cao hơn cho độ phân biệt của từng câu.
3. Chỉ số B
Độ khó là một thông số cơ bản của câu trắc nghiệm và được dùng cho mọi loại trắc nghiệm, còn độ phân biệt thì chỉ sử dụng cho loại “trắc nghiệm chuẩn mực”. Đây là thuật ngữ do cố GS Dương Thiệu Tống đưa ra, nhưng không rõ nghĩa; tôi đề nghị một cách dịch khác là “trắc nghiệm quy chiếu nhóm chuẩn”, trong đó “nhóm chuẩn”, tức “norm group”, là để chỉ nhóm đại diện tiêu biểu cho các thí sinh là đối tượng kiểm tra của bài trắc nghiệm. Đáp ứng của nhóm chuẩn trên bài trắc nghiệm sẽ được sử dụng để tính các thông số cần thiết của câu trắc nghiệm theo các nguyên tắc thống kê. Loại trắc nghiệm này – tiếng Anh là norm-referenced test – được dùng để so sánh các thí sinh với nhau, ví dụ như trong kỳ thi tuyển sinh đại học, cần biết ai giỏi hơn ai để ra quyết định lựa chọn người học trong trường hợp không có đủ chỗ cho mọi thí sinh.
Trong giáo dục còn một loại test khác ngày càng được xem là quan trọng, đó là criterion-referenced test mà cố GS DTT gọi là “trắc nghiêm tiêu chí” (mà tôi đề nghị dịch là trắc nghiệm quy chiếu tiêu chí, trong đó tiêu chí là một căn cứ khách quan bên ngoài để quy chiếu những đáp ứng của thí sinh trên bài kiểm tra). Đối với loại trắc nghiệm này thì độ phân biệt không có ý nghĩa, vì nếu nội dung kiểm tra là quan trọng (ví dụ trong tiếng Anh cần phải dạy cho học sinh biết cách dùng mạo từ), thì nếu mọi thí sinh làm không được (tức độ khó là 0), câu hỏi đó vẫn có ý nghĩa và vẫn phải sử dụng. Trong trường hợp này, để đánh giá giá trị của câu trắc nghiệm, người ta dùng chỉ số B.
Ký hiệu B trong tên gọi chỉ số B là từ viết tắt của tên người đặt ra nó vào năm 1972 là Brennan. B-index được tính toán giống như người ta tính ID, nhưng thay vì so sánh giữa nhóm giỏi và nhóm kém dựa trên kết quả tổng điểm trên cùng một bài thi, thì người ta so sánh giữa nhóm đậu và nhóm rớt trên bài thi đó, dựa trên mức điểm sàn. Ví dụ, một bài thi được quy ước là phải đạt 70% số câu đúng mới được xem là đat, thì mọi thí sinh đạt từ 70/100 điểm trở lên sẽ thuộc nhóm đậu, còn dưới 70 điểm sẽ thuộc nhóm rớt. Chỉ số B-index có giá trị 0.5 chẳng hạn, sẽ được hiểu là số thí sinh thuộc nhóm đậu làm đúng câu này cao hơn số thí sinh thuộc nhóm rớt là 50%. Câu có B-index càng cao thì càng có khả năng phân biệt được thí sinh “thành thạo” và “không thành thạo”.
Tài liệu tham khảo
http://www.grin.com/en/doc/269580/using-the-right-tool-for-the-job-an-analysis-of-item-selection-statistics
The B- Index
The B-index was developed by Brennan (1972) and is based on the concept of discriminating between upper and lower groups in norm-referenced testing. These upper and lower groups are typically defined as the upper and lower twenty-seven percent. Brennan developed an application of discrimination that was appropriate for mastery tests. In a mastery-test context, upper and lower groups are defined by whether or not they are classified as masters. Therefore, B is the difference in the difficulty of the item for the mastery and non-mastery groups. For example, a B value of 0.50 would be interpreted as the proportion correct is .50 higher in the mastery than in the non-mastery group. Larger B values can be interpreted as greater discrimination between mastery and non-mastery groups for that specific item.
(còn tiếp)
1. Độ khó
Thông số cơ bản, cũng là điều tối thiểu một ngân hàng câu hỏi phải có, là độ khó/độ dễ của câu hỏi, tiếng Anh gọi là item facility, ký hiệu là IF (ngày xưa gọi là item difficulty). Độ khó này không phải là phán đoán chủ quan của người ra đề (mặc dù đây cũng là một loại thông tin cần thiết trong ngân hàng, nếu có), mà là một con số có được từ thực tế sử dụng (ngôn ngữ của thống kê là “dữ liệu thực nghiệm” – empirical data), tức kết quả kiểm tra của người học trên từng câu (khoa học trắc nghiệm gọi là “dữ liệu đáp ứng” – response data).
Tính độ khó của một câu hỏi trắc nghiệm vô cùng đơn giản, vì nó chỉ là một bài toán chia: lấy số người làm đúng chia cho tổng số người làm. Giá trị của nó là từ 0 (không có ai làm đúng) đến 1 (tất cả mọi người đều làm đúng), nhưng thông thường hai trường hợp này rất hiếm khi xảy ra. Độ khó lý tưởng của một câu trắc nghiệm thì tùy thuộc vào mục đích của người sử dụng, nhưng thông thường người ta thích dùng những câu từ 0.3 (tương đối khó) đến 0.7 (tương đối dễ). Đôi khi có thể nới rộng phạm vi ra từ 0.2 đến 0.9, nhưng ít khi vượt quá mức này, vì lúc ấy chúng trở nên quá khó hoặc quá dễ, và điều này sẽ ảnh hưởng đến độ phân biệt của câu hỏi trắc nghiệm. (Độ phân biệt là một thông số khác, sẽ được đề cập ở phần sau của entry này).
2. Độ phân biệt
Là một thông số quan trọng khác của câu hỏi trắc nghiệm, và cũng rất đơn giản cả về khái niệm lẫn về tính toán. Tiếng Anh gọi độ phân biệt (có người gọi là độ phân cách) là item discrimination, ký hiệu là ID. Đây là một chỉ số đo khả năng phân biệt giữa người làm giỏi và người làm kém của từng câu trắc nghiệm, được tính bằng trung bình điểm từng câu trắc nghiệm của nhóm giỏi trừ trung bình điểm của nhóm kém.
Giá trị của độ phân biệt dao động từ -1 (tất cả mọi người giỏi đều làm sai, điểm trung bình là 0, trong khi tất cả mọi người kém đều làm đúng, điểm trung bình là 1) đến 1 (tình trạng ngược lại). Độ phân biệt được xem là tốt nếu nó có giá trị từ 0.3 trở lên, và tất nhiên là càng cao thì càng tốt. Tuyệt đối trong đề thi không được có câu có độ phân biệt âm (vậy mà trên thực tế thi cử của VN thì vẫn có đấy các bạn ạ, vì thỉnh thoảng tôi vẫn có cơ hội để phân tích số liệu thi cử mà).
Người ta lấy điểm tổng của một bài thi có nhiều câu để làm căn cứ xác định nhóm giỏi và nhóm kém. Tất cả thí sinh được sắp xếp theo thứ tự điểm tổng, và nhóm giỏi được xác định là 1/3 (tức 33%) số thí sinh có điểm cao nhất, còn nhóm kém là 1/3 có điểm thấp nhất. Tuy nhiên, tùy theo tình hình thực tế, người ta cũng có thể lấy một tỷ lệ thấp hơn 33% nhưng không dưới 25% để có được một giá trị cao hơn cho độ phân biệt của từng câu.
3. Chỉ số B
Độ khó là một thông số cơ bản của câu trắc nghiệm và được dùng cho mọi loại trắc nghiệm, còn độ phân biệt thì chỉ sử dụng cho loại “trắc nghiệm chuẩn mực”. Đây là thuật ngữ do cố GS Dương Thiệu Tống đưa ra, nhưng không rõ nghĩa; tôi đề nghị một cách dịch khác là “trắc nghiệm quy chiếu nhóm chuẩn”, trong đó “nhóm chuẩn”, tức “norm group”, là để chỉ nhóm đại diện tiêu biểu cho các thí sinh là đối tượng kiểm tra của bài trắc nghiệm. Đáp ứng của nhóm chuẩn trên bài trắc nghiệm sẽ được sử dụng để tính các thông số cần thiết của câu trắc nghiệm theo các nguyên tắc thống kê. Loại trắc nghiệm này – tiếng Anh là norm-referenced test – được dùng để so sánh các thí sinh với nhau, ví dụ như trong kỳ thi tuyển sinh đại học, cần biết ai giỏi hơn ai để ra quyết định lựa chọn người học trong trường hợp không có đủ chỗ cho mọi thí sinh.
Trong giáo dục còn một loại test khác ngày càng được xem là quan trọng, đó là criterion-referenced test mà cố GS DTT gọi là “trắc nghiêm tiêu chí” (mà tôi đề nghị dịch là trắc nghiệm quy chiếu tiêu chí, trong đó tiêu chí là một căn cứ khách quan bên ngoài để quy chiếu những đáp ứng của thí sinh trên bài kiểm tra). Đối với loại trắc nghiệm này thì độ phân biệt không có ý nghĩa, vì nếu nội dung kiểm tra là quan trọng (ví dụ trong tiếng Anh cần phải dạy cho học sinh biết cách dùng mạo từ), thì nếu mọi thí sinh làm không được (tức độ khó là 0), câu hỏi đó vẫn có ý nghĩa và vẫn phải sử dụng. Trong trường hợp này, để đánh giá giá trị của câu trắc nghiệm, người ta dùng chỉ số B.
Ký hiệu B trong tên gọi chỉ số B là từ viết tắt của tên người đặt ra nó vào năm 1972 là Brennan. B-index được tính toán giống như người ta tính ID, nhưng thay vì so sánh giữa nhóm giỏi và nhóm kém dựa trên kết quả tổng điểm trên cùng một bài thi, thì người ta so sánh giữa nhóm đậu và nhóm rớt trên bài thi đó, dựa trên mức điểm sàn. Ví dụ, một bài thi được quy ước là phải đạt 70% số câu đúng mới được xem là đat, thì mọi thí sinh đạt từ 70/100 điểm trở lên sẽ thuộc nhóm đậu, còn dưới 70 điểm sẽ thuộc nhóm rớt. Chỉ số B-index có giá trị 0.5 chẳng hạn, sẽ được hiểu là số thí sinh thuộc nhóm đậu làm đúng câu này cao hơn số thí sinh thuộc nhóm rớt là 50%. Câu có B-index càng cao thì càng có khả năng phân biệt được thí sinh “thành thạo” và “không thành thạo”.
Tài liệu tham khảo
http://www.grin.com/en/doc/269580/using-the-right-tool-for-the-job-an-analysis-of-item-selection-statistics
The B- Index
The B-index was developed by Brennan (1972) and is based on the concept of discriminating between upper and lower groups in norm-referenced testing. These upper and lower groups are typically defined as the upper and lower twenty-seven percent. Brennan developed an application of discrimination that was appropriate for mastery tests. In a mastery-test context, upper and lower groups are defined by whether or not they are classified as masters. Therefore, B is the difference in the difficulty of the item for the mastery and non-mastery groups. For example, a B value of 0.50 would be interpreted as the proportion correct is .50 higher in the mastery than in the non-mastery group. Larger B values can be interpreted as greater discrimination between mastery and non-mastery groups for that specific item.
(còn tiếp)
Subscribe to:
Posts (Atom)