• невозможно провести абсолютную экспертизу качества работы каждого эксперта;
• вся информация представляет собой набор работ, оцененных двумя, редко тремя экспертами.
В этом случае определение влияния экспертов на оценку проводится на основе анализа всевозможных парных сравнений с учетом следующих принципов:
• если эксперт серьезно завышает оценку в сравнении с другими экспертами либо серьезно занижает, то такая оценка учитывается меньше;
• если эксперт проявляет несогласованность с действиями других экспертов в достаточно большом числе работ, занижает оценку в сравнении с более строгими (менее лояльными) экспертами или завышает в сравнении с более мягкими (более лояльными), то его оценки также учитываются меньше;
• «веса» экспертов имеют смысл только внутри оцениваемой выборки.
Для определения «веса» экспертов строится квадратная матрица, элементы которой определяются по формуле:
где si, sj – сумма баллов по всем заданиям части «С» по всем работам, совместно проверенным i-м и j – м экспертами; C max – максимально возможная суммарная оценка за эти задания.
где
Аналогично для каждого эксперта строится
где сумма берется по всем j, для которых либо li lj и rij0, либо li lj и rji 0.
Оба эксперта, проверявших одну и ту же работу, всегда находятся в одной связной компоненте, поэтому их параметры можно между собой сравнивать, что позволяет получать компромиссную оценку для данной работы:
где
Исходя из этого построение компромиссной экспертной оценки следует из принципов:
• компромиссная оценка не должна быть ниже наименьшей оценки экспертов и выше наибольшей, она должна принадлежать множеству допустимых значений оценок большинства экспертов;
• оценки экспертов, дававших стабильно завышенные или заниженные результаты либо показывавших очень нестабильные результаты, учитываются тем меньше, чем в большей мере наблюдаются данные недостатки.
Окончательной считается оценка, построенная как взвешенная сумма оценок двух экспертов. В большинстве случаев компромиссная оценка вычисляется путем арифметического усреднения и последующего округления.
Если же в оценках экспертов имеют место значительные расхождения, то для проверки назначается третий эксперт. Независимая оценка третьего эксперта за решения всех заданий в этом случае считается окончательной, если она не выходит за границы интервала баллов, определенных первыми двумя экспертами.
При шкалировании результатов единого государственного экзамена учитываются только окончательные оценки.
Вопросы и задания
1. Какие виды тестов используются в образовании?
2. Чем принципиально отличаются классические тесты от контрольных измерительных материалов современного тестирования?
3. В чем особенность конструирования тестов по методологии IRT?
4. Перечислите основные статистические характеристики тестовых заданий.
5. Какую информацию дает характеристическая кривая о качестве тестового задания?
6. Что понимается под эффективностью теста?
7. Перечислите основные принципы выделения контролируемых дидактических единиц для создания теста.
8. Перечислите основные этапы конструирования теста.
9. Какие формы тестовых заданий используются в ЕГЭ?
10. Какие виды шкал используются в образовании при контроле?
11. Чем различаются первичные и тестовые баллы?
Глава 4
ТЕОРЕТИЧЕСКИЕ ОСНОВЫ КВАЛИМЕТРИЧЕСКОГО МОНИТОРИНГА КАЧЕСТВА ОБУЧЕНИЯ
Предмет математики настолько серьезен,
что полезно не упускать случая сделать его
немного занимательным.
4.1. Виды мониторинга в образовании