Tuesday, October 4, 2011

Xây dựng ngân hàng câu hỏi trắc nghiệm (2): Những thông số cần có trong ngân hàng câu hỏi

Một ngân hàng câu hỏi trắc nghiệm theo nghĩa rộng nhất có thể chỉ đơn thuần là một tập hợp các câu hỏi được lưu giữ và sắp xếp để thuận tiện cho việc sử dụng. Theo nghĩa này, thì một ngân hàng câu hỏi thậm chí có thể là bản cứng (trên giấy), chứ không cần có một cơ sở dữ liệu điện tử. Nhưng ngày nay, với sự hỗ trợ mạnh mẽ của máy tính, để được xem là một ngân hàng câu hỏi thì bắt buộc mỗi câu hỏi này còn phải kèm theo những thông số kỹ thuật nữa. Theo lý thuyết trắc nghiệm cổ điển CTT, những thông số đó gồm có: độ khó, độ phân biệt, và chỉ số B.

1. Độ khó
Thông số cơ bản, cũng là điều tối thiểu một ngân hàng câu hỏi phải có, là độ khó/độ dễ của câu hỏi, tiếng Anh gọi là item facility, ký hiệu là IF (ngày xưa gọi là item difficulty). Độ khó này không phải là phán đoán chủ quan của người ra đề (mặc dù đây cũng là một loại thông tin cần thiết trong ngân hàng, nếu có), mà là một con số có được từ thực tế sử dụng (ngôn ngữ của thống kê là “dữ liệu thực nghiệm” – empirical data), tức kết quả kiểm tra của người học trên từng câu (khoa học trắc nghiệm gọi là “dữ liệu đáp ứng” – response data).

Tính độ khó của một câu hỏi trắc nghiệm vô cùng đơn giản, vì nó chỉ là một bài toán chia: lấy số người làm đúng chia cho tổng số người làm. Giá trị của nó là từ 0 (không có ai làm đúng) đến 1 (tất cả mọi người đều làm đúng), nhưng thông thường hai trường hợp này rất hiếm khi xảy ra. Độ khó lý tưởng của một câu trắc nghiệm thì tùy thuộc vào mục đích của người sử dụng, nhưng thông thường người ta thích dùng những câu từ 0.3 (tương đối khó) đến 0.7 (tương đối dễ). Đôi khi có thể nới rộng phạm vi ra từ 0.2 đến 0.9, nhưng ít khi vượt quá mức này, vì lúc ấy chúng trở nên quá khó hoặc quá dễ, và điều này sẽ ảnh hưởng đến độ phân biệt của câu hỏi trắc nghiệm. (Độ phân biệt là một thông số khác, sẽ được đề cập ở phần sau của entry này).

2. Độ phân biệt
Là một thông số quan trọng khác của câu hỏi trắc nghiệm, và cũng rất đơn giản cả về khái niệm lẫn về tính toán. Tiếng Anh gọi độ phân biệt (có người gọi là độ phân cách) là item discrimination, ký hiệu là ID. Đây là một chỉ số đo khả năng phân biệt giữa người làm giỏi và người làm kém của từng câu trắc nghiệm, được tính bằng trung bình điểm từng câu trắc nghiệm của nhóm giỏi trừ trung bình điểm của nhóm kém.

Giá trị của độ phân biệt dao động từ -1 (tất cả mọi người giỏi đều làm sai, điểm trung bình là 0, trong khi tất cả mọi người kém đều làm đúng, điểm trung bình là 1) đến 1 (tình trạng ngược lại). Độ phân biệt được xem là tốt nếu nó có giá trị từ 0.3 trở lên, và tất nhiên là càng cao thì càng tốt. Tuyệt đối trong đề thi không được có câu có độ phân biệt âm (vậy mà trên thực tế thi cử của VN thì vẫn có đấy các bạn ạ, vì thỉnh thoảng tôi vẫn có cơ hội để phân tích số liệu thi cử mà).

Người ta lấy điểm tổng của một bài thi có nhiều câu để làm căn cứ xác định nhóm giỏi và nhóm kém. Tất cả thí sinh được sắp xếp theo thứ tự điểm tổng, và nhóm giỏi được xác định là 1/3 (tức 33%) số thí sinh có điểm cao nhất, còn nhóm kém là 1/3 có điểm thấp nhất. Tuy nhiên, tùy theo tình hình thực tế, người ta cũng có thể lấy một tỷ lệ thấp hơn 33% nhưng không dưới 25% để có được một giá trị cao hơn cho độ phân biệt của từng câu.

3. Chỉ số B
Độ khó là một thông số cơ bản của câu trắc nghiệm và được dùng cho mọi loại trắc nghiệm, còn độ phân biệt thì chỉ sử dụng cho loại “trắc nghiệm chuẩn mực”. Đây là thuật ngữ do cố GS Dương Thiệu Tống đưa ra, nhưng không rõ nghĩa; tôi đề nghị một cách dịch khác là “trắc nghiệm quy chiếu nhóm chuẩn”, trong đó “nhóm chuẩn”, tức “norm group”, là để chỉ nhóm đại diện tiêu biểu cho các thí sinh là đối tượng kiểm tra của bài trắc nghiệm. Đáp ứng của nhóm chuẩn trên bài trắc nghiệm sẽ được sử dụng để tính các thông số cần thiết của câu trắc nghiệm theo các nguyên tắc thống kê. Loại trắc nghiệm này – tiếng Anh là norm-referenced test – được dùng để so sánh các thí sinh với nhau, ví dụ như trong kỳ thi tuyển sinh đại học, cần biết ai giỏi hơn ai để ra quyết định lựa chọn người học trong trường hợp không có đủ chỗ cho mọi thí sinh.

Trong giáo dục còn một loại test khác ngày càng được xem là quan trọng, đó là criterion-referenced test mà cố GS DTT gọi là “trắc nghiêm tiêu chí” (mà tôi đề nghị dịch là trắc nghiệm quy chiếu tiêu chí, trong đó tiêu chí là một căn cứ khách quan bên ngoài để quy chiếu những đáp ứng của thí sinh trên bài kiểm tra). Đối với loại trắc nghiệm này thì độ phân biệt không có ý nghĩa, vì nếu nội dung kiểm tra là quan trọng (ví dụ trong tiếng Anh cần phải dạy cho học sinh biết cách dùng mạo từ), thì nếu mọi thí sinh làm không được (tức độ khó là 0), câu hỏi đó vẫn có ý nghĩa và vẫn phải sử dụng. Trong trường hợp này, để đánh giá giá trị của câu trắc nghiệm, người ta dùng chỉ số B.

Ký hiệu B trong tên gọi chỉ số B là từ viết tắt của tên người đặt ra nó vào năm 1972 là Brennan. B-index được tính toán giống như người ta tính ID, nhưng thay vì so sánh giữa nhóm giỏi và nhóm kém dựa trên kết quả tổng điểm trên cùng một bài thi, thì người ta so sánh giữa nhóm đậu và nhóm rớt trên bài thi đó, dựa trên mức điểm sàn. Ví dụ, một bài thi được quy ước là phải đạt 70% số câu đúng mới được xem là đat, thì mọi thí sinh đạt từ 70/100 điểm trở lên sẽ thuộc nhóm đậu, còn dưới 70 điểm sẽ thuộc nhóm rớt. Chỉ số B-index có giá trị 0.5 chẳng hạn, sẽ được hiểu là số thí sinh thuộc nhóm đậu làm đúng câu này cao hơn số thí sinh thuộc nhóm rớt là 50%. Câu có B-index càng cao thì càng có khả năng phân biệt được thí sinh “thành thạo” và “không thành thạo”.

Tài liệu tham khảo
http://www.grin.com/en/doc/269580/using-the-right-tool-for-the-job-an-analysis-of-item-selection-statistics

The B- Index
The B-index was developed by Brennan (1972) and is based on the concept of discriminating between upper and lower groups in norm-referenced testing. These upper and lower groups are typically defined as the upper and lower twenty-seven percent. Brennan developed an application of discrimination that was appropriate for mastery tests. In a mastery-test context, upper and lower groups are defined by whether or not they are classified as masters. Therefore, B is the difference in the difficulty of the item for the mastery and non-mastery groups. For example, a B value of 0.50 would be interpreted as the proportion correct is .50 higher in the mastery than in the non-mastery group. Larger B values can be interpreted as greater discrimination between mastery and non-mastery groups for that specific item.

(còn tiếp)

Monday, October 3, 2011

Viết tiếp về Action Research (2)

Lần đầu tiên tôi viết về action research trên blog này cách đây đã khá lâu rồi. Định viết tiếp mà mãi chưa viết được, nhưng không phải là không nghĩ về nó. Vì nó là một phần công việc của những người làm nghề giống tôi, có thể xem là institutional research.

Action research ở VN thì có lẽ chẳng mấy ai biết, hoặc có biết sơ sơ thì cũng chẳng coi nó ra gì. Nhưng trên thế giới thì lại khác, thậm chí riêng trong ngành giáo dục thì nó còn có hẳn tạp chí riêng của mình nữa đấy. Ít ra là một cuốn, loại mà tôi đang đọc (tôi nghĩ có lẽ phải nhiều hơn một chứ).

Vâng, tôi đang cầm trên tay 2 cuốn tạp chí (số 1 và số 2 của Volume 19) có tựa là Educational Action Research (viết tắt là EAR, tạm dịch là Nghiên cứu hành động – NCHĐ – trong giáo dục) đây, một tờ tạp chí quốc tế của NXB Routledge thuộc T&F Group. Đây là lần đầu tiên tôi có tiền để subscribe tờ báo này, và có lẽ cũng là (một trong những) người/nơi đầu tiên đọc tạp chí này, ở VN tất nhiên.

Tại sao tôi dám nghĩ tôi là người đầu tiên ở VN đọc cuốn tạp chí này nhỉ (xin làm rõ: khi nói người VN đầu tiên, ý tôi muốn nói là những người VN sinh sống và làm việc tại VN trong điều kiện bình thường ở VN, chứ không tính những người Việt đang học trong môi trường quốc tế). Xin thưa: vì ở VN, ngành giáo dục vốn là một trong những ngành nghèo nhất, ít người chọn theo học nhất, và lại cũng bị hiểu sai nhiều nhất. Người ta hiểu là ngành giáo dục chẳng cần nghiên cứu gì sất, cứ dựa vào kinh nghiệm mà làm thôi.

Mà nếu có nghiên cứu thì cứ phải đo đạc, thí nghiệm, thống kê gì gì đấy thì mới đáng xem là nghiên cứu, chứ làm gì có cái gì gọi là action research cơ chứ? Cho nên, nếu có ai thuộc ngành giáo dục (hoặc một số ngành xã hội nhân văn nào khác) mà đem mấy cái “nghiên cứu” theo phương pháp action research của mình ra khoe, thì chắc thế nào cũng bị cộng đồng khoa học VN – vốn được thống trị tuyệt đối bởi những người thuộc khối kỹ thuật và tự nhiên, và gần đây có thêm kinh tế và tâm lý cũng được tham gia vào cái “exclusive club” này – đập cho tơi tả, dè bỉu đủ kiểu:

“Ối giời ơi, thế này mà chúng nó (tức cái đám xã hội nhân văn dốt nát ấy, như tôi chẳng hạn) cũng dám gọi là nghiên cứu đây à? Xấu hổ quá, nhục quá!!!” Chắc chắn là như thế, vì tôi cũng đã bị rồi đấy các bạn ạ, mà trong giới của tôi (kể cả trong và ngoài nước) thì tôi đâu có đến nỗi nào nhỉ, cũng được đánh giá tốt đấy chứ! :-)

Quay trở lại Action Research. Đã từ lâu tôi muốn viết về loại nghiên cứu này, và đã có lần viết một entry trên blog, cũng nhận được nhiều ý kiến phản hồi tích cực lắm, nhưng chưa có thời gian, và nhất là chưa có điều kiện. Vì muốn viết thì không thể chỉ dựa vào kinh nghiệm cá nhân (đã có từ cách đây hơn 15 năm rồi) và search trên mạng rồi viết, mà phải có điều kiện tiếp cận và cập nhật hàng ngày.

Khổ nỗi là tài liệu, sách vở, tạp chí của VN lại quá ít, quá thiếu, nếu có thì cũng chỉ có những ngành kỹ thuật, kinh tế vv thôi, chứ ngành giáo dục của tôi thì rất ít, và làm gì có tài liệu nước ngoài thường xuyên mà đọc. Nay, đã nghỉ khỏi khu vực công, làm cho tư nhân lương có cao hơn một chút (thực ra là cao hơn … nhiều chút chứ không phải chỉ một chút), tôi mới dám bấm bụng subscribe tạp chí này để đọc thường xuyên, nên mới khoe các bạn đấy ạ.

Mà này, nó đắt lắm nhé, một năm hơn 100 USD mà chỉ có 4 số thôi, mỗi số chỉ có khoảng 100 trang, có chừng 4, 5 articles thôi, và thỉnh thoảng có một bài điểm sách. Tính ra mỗi article là phải trả đến 20, 25 USD cơ đấy. Quý thế, nên đọc một mình thì uổng, thôi thì tôi share lên đây cho mọi người cùng đọc nhé.

Riêng 2 số đầu tiên của Volume 19 (năm 2011) thì có những bài sau đây đáng đọc, ghi lên đây để ai có hỏi thì liên hệ với tôi (vtpanh@gmail.com). Ba bài đầu thuộc số 1, 2 bài sau thuộc số 2.

1. Breakthroughs in action research through poetry (những đột phá trong NCHĐ thông qua thơ) – của Terry Barrett.

2. Collaborative action research approaches promoting professional development for elementary school teachers (Các cách tiếp cận NCHĐ hợp tác nhằm thúc đẩy phát triển nghề nghiệp của giáo viên tiểu học) của Jaipal và Figg.

3. Examining the long-term impact of collaborative action research on teacher identity and practice: the perceptions of K-12 teachers (Xem xét ảnh hưởng lâu dài của NCHĐ hợp tác đối với cách suy nghĩ và hành động của giảng viên: những cảm nhận của giáo viên phổ thông) của Goodnough.

4. Exploring the utility of action research to investigate second-language classrooms as complex systems (Tìm hiểu ứng dụng của NCHĐ trong việc nghiên cứu lớp học ngoại ngữ như những hệ thống phức hợp) của Ahmadian và Tavakoli.

5. Is action research a contradiction in terms? Do communities of practice mean the end of educational research as we know it? Some remarks based on one recent example of religious educational research (NCHĐ phải chăng là một từ ngữ mâu thuẫn? Phải chăng các cộng đồng thực hành cũng đồng nghĩa với việc chấm dứt nghiên cứu giáo dục theo cách mà chúng ta vẫn biết? Một vài nhận xét dựa trên một nghiên cứu giáo dục tôn giáo) của O’Grady.

Tạm thời viết đến đây, tôi còn phải đọc, đọc thấy cái gì hay thì lại viết tiếp và đưa lên đây nhé. Blog đúng là tuyệt, nó là nhật ký nghề nghiệp mở và có tương tác của tôi, và giúp tôi rất nhiều trong việc có thêm những trao đổi với các đồng nghiệp ở khắp nơi trên cả nước (và cả thế giới nữa). Read, enjoy, and discuss, các bạn nhé!