Тема N. Фиктивная зависимая переменная

Тема N. Фиктивная зависимая переменная

1 To be, or not to be Уильям Шекспир Тема N. Фиктивная зависимая переменная Общая постановка задачи Имеется выборка, в которой зависимая переменная Y является качественной (с двумя альтернативами), а независимые переменные могут быть как качественными, так и количественными. Необходимо построить модель, в которой Y f ( x, x 2. ). Задание Y в виде Y, -я альтернатива,, позволяет переформулировать задачу, 2-я альтернатива. как вероятностную. Какова вероятность того, что Y примет значение одной из альтернатив, при конкретном наборе факторов? Пример. В России имеется около 6 скважин, добыча из которых ведется с использованием ЭЦН. Имеется выборка по ЭЦН. Требуется оценить работоспособность насоса в зависимости от его срока службы. Переформулируем задачу следующим образом: как зависит вероятность выхода из строя насоса от его возраста (в месяцах). Зададим Y, насос исправен,, насос сломан. Построение линейной МНК модели приводит к а) невозможным значениям зависимой переменной, например BREAK() -.2; б) нарушению логики

2 Тема N. Фиктивная зависимая переменная вероятность поломки растет с возрастом линейно, в то время как на самом деле новые насосы ломаются очень редко, а несломанных насосов старше 3.5 лет почти нет. logit модель Зададим вероятность того, что зависимая переменная примет значение, в виде P( Y x ; x ;. x n ) k x k x k x b 2 ( n n ) e. Такая форма задания переменной позволяет справиться с а) выходом вероятности за границы [;]; б) линейностью изменения вероятности при изменении факторов. Однако при такой форме зависимости коэффициенты включены в модель нелинейно и напрямую использовать МНК невозможно. Общепринято обозначать за z kx k2x2. k n x n b и находить коэффициенты методом максимального правдоподобия. В Eviews logit модель можно построить путем выбора в окне уравнения метода BINARY Binary choice ( ), а среди предложенных методов оценки отметив Logit. Для рассмотренного выше примера модель может быть записана следующим образом break вероятностью к области с вероятностью близкой к единице. e (.4age 4.9). То, какие именно коэффициенты определятся в модели, влияет на скорость роста вероятности. Графически это выражается в крутизне перехода от области с почти нулевой По графику зависимости break ( age ) можно заметить, что новые насосы (до месяцев) почти не ломаются. На промежутке от 25 до 4 месяцев вероятность растет почти линейно с возрастом. Более старые насосы ломаются с вероятностью более 8%. 2

3 Вероятность поломки насоса в зависимости от его возраста dbreak dage Рис.. Зависимость break от age Для более четкого понимания роли возраста стоит вычислить производную. Она покажет скорость, с которой растет вероятность поломки: z dbreak e dz e z dage ( e ) dage ( e ) (.4age 4.9).4 2 (.4age 4.9) 2. По графику (рис. 2) видно, что максимум воздействия возраста приходится на период месяцев. В соответствии с моделью увеличение возраста насоса на месяц с 34 до 35 месяцев увеличивает вероятность поломки на 3.5%. Эта вероятность невелика, т.е. большое количество насосов старше 35 месяцев продолжают работать. Выборочный возраст насосов ограничен 49 месяцами. Незначительное количество (существенно менее половины) насосов в выборке сломаны. Поэтому график вероятности (рис. ) не доходит до, а график предельного воздействия (рис. 2) оборван справа и не доходит до Предельное воздействие возраста насоса на его поломку Рис. 2. Скорость поломок в зависимости от возраста насоса 3

4 Тема N. Фиктивная зависимая переменная probit модель Зададим вероятность того, что зависимая переменная примет значение, в виде P( Y x ; x ;. x ) ( k x k x. k x b ), т.е. функции стандартного нормального 2 n 2 2 n n распределения. Такая форма задания переменной также позволяет а) соблюдать границы вероятности [;]; б) нелинейно менять вероятность при изменении факторов. Однако при такой форме зависимости коэффициенты снова включены в модель нелинейно и напрямую использовать МНК невозможно. Общепринято обозначать за z kx k2x2. k n x n b и находить коэффициенты модели методом максимального правдоподобия. В Eviews probit модель можно построить путем выбора в окне уравнения метода BINARY Binary choice ( ), а среди предложенных методов оценки отметив Probit. Для рассмотренного выше примера модель может быть записана следующим образом break Ф(.74 age 2.564). В Excel зависимость может быть вычислена с помощью встроенной функции НОРМРАСП( z;;;), где z.74 age Вероятность поломки насоса в зависимости от его возраста logit probit По графику зависимости break ( age ) можно заметить, что две модели дают очень похожие прогнозы. Probit модель предлагает немного более пологий рост вероятности, нежели logit. Скорость поломки в модели probit можно вычислить с помощью функции dbreak dz плотности нормального распределения Ф ( z) f ( z).74. В Excel dage dage плотность f() z можно вычислить используя функцию НОРМРАСП( z ;;;). По графику (рис. 3) видно, что максимум воздействия возраста совпадает в двух моделях. Однако величина этого максимума в модели probit на.5% ниже, чем в logit модели. 4

5 Предельное воздействие возраста насоса на его поломку logit probit Рис. 3. Скорость поломок в зависимости от возраста насоса Анализ окна модели В верхней части окна выписан метод построения модели, например: Method: ML - Binary Probit (Quadratic hill climbing). Эта запись означает, что коэффициенты модели были найдены методом максимального правдоподобия (maximum likelihood) для бинарной probit-модели. Будем далее сокращенно писать ММП вместо метода максимального правдоподобия. Рассмотрим верхнюю часть таблицы. Каждой переменной соответствует коэффициент. Это значение коэффициента оценено по выборке. Относительно каждой переменной проверяется гипотеза о равенстве коэффициента при ней, т.е. о том, что соответствующая переменная не влияет на функцию-вероятность (в генеральной совокупности). Приведенные стандартные ошибки коэффициентов являются асимптотическими, т.е. доверять им можно при больших выборках. В связи с этим в программе Eviews вместо t-statistic используют z-statistic расчетное значение стандартного нормального распределения z-statistic Coefficient. Prob. это, при Std. Error условии верности выдвинутой гипотезы, вероятность получения такого или большего расчетного значения z-statistic (для положительного коэффициента)/такого или меньшего расчетного значения z-statistic (для отрицательного коэффициента), т.е. это односторонняя вероятность. Доверительные интервалы для коэффициентов модели следует рассчитывать, используя таблицы статистики Стьюдента. 5

6 Тема N. Фиктивная зависимая переменная Для приведенного выше примера коэффициент.74 с вероятность 95% попадет в интервал (.38;.), рассчитанный по t-statistic и в (.39;.9), рассчитанный по z- Statistic. Т.е. для достаточно больших выборок или для коэффициентов с маленькой Std.Error можно пользоваться таблицами стандартного нормального распределения. В нижней части таблицы имеются уже знакомые нам описательные статистики: среднее значение и стандартное отклонение зависимой переменной, стандартная ошибка регрессии и остаточная сумма квадратов. Они имеют тот же смысл, что в МНКмоделях. Дополнительно приведены несколько статистик ММП: Логарифмическое правдоподобие (Log likelihood) максимизируемое значение функции максимального правдоподобия. Среднее значение логарифмического правдоподобия (Avg. log likelihood) - Avg. log likelihood Log likelihood, n - объем выборки. n Ограниченное логарифмическое правдоподобие (Restr. log likelihood) значение функции максимального правдоподобия в модели с одной лишь константой, т.е. в случае равенства коэффициентов при остальных объясняющих переменных. Restr. log likelihood вычисляется только в моделях со свободным членом. Статистика "отношение правдоподобия" (LR statistic) аналог F-статисики в МНК-моделях. Проверяется значимость модели в целом. Приводится только для моделей со свободным членом. Проверяется гипотеза о совпадении построенной модели и модели только со свободным членом, т.е. возможность одновременного равенства всех коэффициентов модели, кроме свободного члена. Статистика критерия рассчитывается как 2(Log likelihood Restr. log likelihood). В скобках задано количество степеней свободы ( df) количество переменных модели. Probability(LR stat) при условии верности нулевой гипотезы LR stat асимптотически распределена как 2 с указанным выше df числом степеней свободы. McFadden R-squared псевдо коэффициент детерминации в ММП-моделях, аналог соответствующего коэффициента в МНК-моделях, рассчитывается как Log likelihood Restr. log likelihood и меняется в интервале [;). Может применяться для сравнения моделей между собой, но не имеет понятной интерпретации. 6

7 Теперь обратимся к меню. View/Expectation-Prediction Table этот пункт меню позволяет увидеть в скольких случаях построенная модель, а также лучшая константа, «угадала» значение зависимой переменной, а в скольких «ошиблась». При вызове этого пункта возникает окно, в котором по умолчанию стоит значение.5. Это число показывает, что при прогнозе выше него бинарная переменная приняла значение, а ниже него. Соответственно можно задать любое значение из интервала (;). Обратимся к следующему пункту меню View/Goodness-of-Fit Test. Он дает дополнительную возможность проверить качество построенной модели, т.е. степень совпадения реальных и предсказанных значений вероятности. Для этого данные группируются по какой-нибудь переменной или с помощью квантилей (m групп), определяется реальное (Actual) количество наблюдений, попавших в каждый интервал, и рассчитывается по модели ожидаемая частота (Expect) попадания в этот интервал. Близость теоретических и реальных частот оценивается с помощью критериев согласия Хосмера-Лемешова (Hosmer-Lemeshow) и Андрюса (Andrews). Асимптотически статистики этих критериев имеют распределение 2 с числом степеней свободы m-2 и m соответственно. Низкие значения вероятности показывают, что гипотезу отвергают, а значит, имеются существенные различия между реальными и предсказанными значениями вероятностей. Литература:. Бородич С.А. Эконометрика. Учебное пособие. Минск: Новое знание, с. 2. Доугерти К. Введение в эконометрику. - М.: ИНФРА-М, с. 3. Program Eviews. User's Guide. 7

📎📎📎📎📎📎📎📎📎📎