Microeconomía III
Medición de Impacto de Programas
(Heckman, 1998)
Jaime Ruiz-Tagle
Departamento de Economía, Universidad de Chile
Motivación
De vuelta al origen...
Suponga que usted estima el siguiente modelo:
yi = xi β + ui
Donde yi es la variable dependiente; xi variables de control; y ui el
término de error.
Supuesto clave para tener estimaciones insesgadas : E [xi , ui ] = 0.
¿Qué significa esto? ¿Es razonable este supuesto en Ciencias Sociales?
¿En Economía?
¿Qué mide el parámetro de interés?
yi = xi β + ui
β = ∂ yi /∂ xi
Variación entre individuos i. Es decir, captura una variación crosssection.
También podríamos tener una variación en el tiempo: un mismo individuo observado en distintos momentos del tiempo. Es decir una variación
time-series.
Más variaciones permiten una mejor “identificación”. Es decir, de forma
simultánea. Variación de [cross-section + time] → datos de panel.
Contexto: examinando la causalidad
Se desea evaluar el efecto de un curso de capacitación laboral (o empresarial) sobre los ingresos de los trabajadores (o empresarios).
El procedimiento estándar en este caso consiste en obtener una muestra
de m = 2n trabajadores y asignar “aleatoriamente” el tratamiento D (la
capacitación) a la mitad de la muestra.
La otra mitad queda excluida, conformando un grupo de control, el que
puede utilizarse para construir el escenario contrafactual.
Contexto
Escenario contrafactual : Determina lo que le hubiera pasado a los participantes del programa si ellos no hubieran participado.
Dado esto, un buen estimador de qué tan eficaz es el tratamiento será
comparar los salarios promedios “post-tratamiento” entre grupos:
D = α = ȳ 1 − ȳ 0
“0” = Control; “1” = Tratamiento.
Contexto
Donde se tiene que:
∑nj=1 yj1
ȳ =
n
1
;
1
∑m
j=n+1 yj
ȳ =
n
0
ȳ 1 es el salario promedio de los trabajadores que participaron en el programa.
▶ ȳ 0 es el salario promedio de los que no participaron.
▶
Heckman 1998
Podríamos pensar que el salario de cada individuo depende de otras
variables como por ejemplo sexo, edad, educación, experiencia laboral,
etc.
Supongamos que la información sobre estas variables se resume en el
vector xi .
Por lo tanto, el salario de cada participante estará dado por:
yi1 = xi β 1 + α + ui1 ,
donde ui1 resume otras características no observadas de la persona que
influyen en sus ingresos.
Heckman 1998
De la misma forma para los miembros del grupo de control se tiene que
el salario está dado por
yi0 = xi β 0 + ui0 .
En línea con Heckman (1998) podremos resumir lo anterior en una sola
expresión para el resultado observado:
yi = Dyi1 + (1 − D)yi0 ,
donde D = 1 si la persona está en el grupo de tratamiento; D = 0 si
está en el grupo de control.
Heckman 1998
Reemplazamos las expresiones que obtuvimos anteriormente para el salario de cada grupo para llegar a
yi = xi β 0 + Dxi (β 1 − β 0 ) + αD + ui0 + D(ui1 − ui0 ).
Heckman 1998
Si suponemos que:
Los coeficientes de ambos modelos son iguales en todas sus pendientes
excepto por una constante.
βj1 = βj0 ;
j = 1, ..., K
Los no observables son iguales entre ambos grupos.
uj1 = uj0
El modelo anterior se podrá escribir de la siguiente forma:
yi = xi β + αD + ui ,
siendo α el impacto del curso de capacitación sobre los salarios del
capacitado.
Heckman 1998
En estricto rigor, no sería necesario en un modelo de este tipo siquiera
controlar por las variables xi por cuanto la asignación “al azar” (aleatorización) asegura que las mismas en promedio son iguales para ambos
grupos.
Debe tenerse en cuenta que la aleatorización falla cuando la misma
influye en la autoselección de los individuos, cuando existen drop-outs
o cuando existen posibilidades de obtener servicios sustitutos por parte
del grupo de control (sesgo de contaminación).
Sesgo de Selección
El problema con la estimación del impacto del programa, se produce
cuando la asignación de las personas a los cursos de capacitación no es
aleatoria.
▶
Por ejemplo que el curso se asigne según interés de los participantes.
En este caso se dice que se está en presencia de un problema de “sesgo
de selección”.
Esta selección se puede deber a expectativas de los participantes (autoselección) o decisiones de los que dan la capacitación (ejecutores del
programa).
Por lo tanto vemos que los incentivos personales pueden ser claves para
determinar la intensión de capacitarse.
Autoselección
Supongamos que las personas tienen solo un período de sus vidas donde
tienen la posibilidad de tomar un curso de capacitación (periodo k).
Desde el comienzo de sus vidas económicas, desde t = 1 hasta t = k las
personas tienen un salario asociado con el estado no capacitación (“0”):
y0 j
j = 1, ..., k
Luego del período k, hay dos potenciales resultados correspondientes a
tomar la capacitación (denotado por “1”) o no hacerlo (“0”):
(y0 j , y1 j )
j = k + 1, ..., T
En T termina la vida económica de la persona.
Autoselección
Por lo tanto, en el período k la persona debe decidir si se capacita o
no.
Consideremos Ik que contiene toda la información disponible para el
agente.
Los costos de participar en el programa están compuestos por:
▶
▶
Costos directos (copago): “cp”
Ingresos laborales a los que se resigna dada la capacitación (ingresos que
deja de recibir mientras se capacita).
Autoselección
Si la capacitación toma un período en tomarse (explica los subíndices
de las sumatorias).
Para un individuo se observará que D = 1 (se capacitará) si se cumple
que:
T −k
T −k
y1,k+j
y0,k+j
−cp − ∑
E ∑
Ik
≥ 0.
j
j
j=1 (1 + r )
j=0 (1 + r )
|
{z
}
|
{z
}
(a)
(b)
(a) = valor presente de los ingresos bajo el estado “capacitación”.
(b) = valor presente de los ingresos bajo el estado “no capacitación”.
Autoselección
Esta regla de decisión trae cuatro importantes consecuencias:
I. La probabilidad de capacitarse cae con la edad de las personas y con sus
tasas subjetivas de descuento.
II. Los ingresos antes del período k son irrelevantes en la decisión de capacitarse, excepto por su valor de para predecir ingresos futuros, entrando
entonces en el set de información.
Autoselección
III. Solamente los costos actuales y el crecimiento futuro en los ingresos
entran en la decisión de participar.
Las personas con bajos ingresos corrientes son los que en forma más
probable participarán.
⋆ Podría darse el caso que personas con buenas cualidades que sólo sufre
una caída transitoria en sus ingresos se inscriban en el programa. Como
luego estos ingresos se recuperan, se tiende a atribuir al programa un
resultado que hubiera ocurrido de todas formas
⋆
IV. La decisión genera una correlación entre el ingreso corriente de la persona
y T.
⋆
Existirá en cualquier momento una correlación entre la variable T y los
resultados del programa. Esto generará un fuerte sesgo en la estimación
del impacto.
Existirá Sesgo de Selección si:
Yi = ingresos observados.
Yi∗ =ingresos sin “tratamiento”.
Di = 1 dummy que identifica si individuo i recibe tratamiento.
α es el impacto del tratamiento sobre los ingresos.
Yi = Yi∗ + α × Di
E[Yi∗ |Di = 1] ̸= E[Yi∗ |Di = 0]
Considere la siguiente línea de tiempo
Sea k momento dónde ocurre la intervención.
Pensemos en t como un periodo luego de la capacitación. Además, se
decide evaluar el impacto del programa sobre los salarios de las personas
participantes.
Sea t ′ un periodo antes de que ocurra la intervención.
t′
k
t
¿Cómo afectará esto a los resultados?
Pensemos que en algún período t luego de la capacitación, se decide
evaluar el impacto del programa sobre los salarios de las personas participantes.
Para ello se comparan sus ingresos con una muestra de no participantes.
Los ingresos promedio de los participantes luego del programa serán
E[yit1 |xit1 , D = 1] = xit1 β + α + E[ui |D = 1]
t > k,
donde xit1 serán todas las características observables que influyen en su
salario.
¿Cómo afectará esto a los resultados?
E[ui |D = 1] muestra la correlación entre variables “no observadas” que
inciden en los salarios y la decisión de participar en el programa de
capacitación.
▶
Notar que ui no tiene en subíndice temporal. Ello se debe a que se está
suponiendo que los factores no observables son constantes o fijos en el
tiempo.
α es el impacto promedio del programa.
De la misma manera los ingresos por parte de una persona del grupo
no participante está dada por
E[yit0 |xit0 , D = 0] = xit0 β + E[ui |D = 0]
t > k.
Impacto del Programa
Los resultados de los no participantes será el escenario contrafactual de
lo que hubiera ocurrido con los participantes en el caso de que no lo
hubieran hecho.
El impacto del programa vendrá dado por:
E[yit1 |xit1 , D = 1] − E[yit0 |xit0 , D = 0]
= (xit1 − xit0 )β + α + E[ui |D = 1] − E[ui |D = 0]
Impacto del Programa
Como se puede apreciar, la estimación de impacto promedio del programa α aparecerá como fuertemente sesgada tanto por diferencias
entre las características observables, como por características no observables de ambos grupos.
Si la selección del grupo de control se hace de forma de que se asemeje
lo más posible en las características observables del tratado (xit1 ≈ xit0 )
lograremos reducir parte del sesgo.
Sin embargo, el sesgo por no observables permanecerá.
Impacto del Programa
Dado que no existe la posibilidad de que a un grupo de participante
se le restrinja aleatoriamente a no participar en el programa, ¿cómo se
pueden obtener estimadores consistentes del impacto?
Solución:
Supongamos que tenemos información “basal” del programa, es decir
tomada al momento del enrolamiento t ′ que es anterior al periodo k en
que se aplica el programa.
Impacto del Programa
El resultado sobre los ingresos “antes” de participar en el grupo de los
futuros participantes estará dado por
E[yit1′ |xit1 ′ , D = 1] = xit1 ′ β + E[ui |D = 1]
t ′ < k.
Para los no participantes es el siguiente:
E[yit0′ |xit0 ′ , D = 0] = xit0 ′ β + E[ui |D = 0]
t ′ < k.
A partir de esta información será posible calcular un estimador consistente
el impacto promedio del programa: este es el estimador de diferencias en
diferencias.
Impacto del Programa
Podremos obtener este dif en dif de la siguiente manera:
(1) Se restan los resultados después del programa (t) con antes del programa
(t ′ ) para los participantes. Con esto logramos remover la correlación
entre las variables no observables y la decisión de participar para este
grupo.
E[∆yit1 |xit1 , D = 1] = E[yit1 |xit1 , D = 1] − E[yit1′ |xit1 ′ , D = 1]
= (xit1 − xit1 ′ )β + α
(2) Se procede de la misma forma con el grupo de comparación:
E[∆yit0 |xit0 , D = 0] = E[yit0 |xit0 , D = 0] − E[yit0′ |xit0 ′ , D = 0]
= (xit0 − xit0 ′ )β
Impacto del Programa
(3) Por último, se resta la diferencia entre los participantes, menos la diferencia entre el grupo de comparación:
E[∆yit1 |xit1 , D = 1] − E[∆yit0 |xit0 , D = 0]
= (xit1 − xit1 ′ )β − (xit0 − xit0 ′ )β + α
Si la evolución de las observables es la misma a lo largo del tiempo
para cada grupo, tendremos que:
E[∆yit1 |xit1 , D = 1] − E[∆yit0 |xit0 , D = 0] = α,
ya que (xit1 − xit1 ′ ) ≈ (xit0 − xit0 ′ ).
Impacto del Programa
De esta forma se podrá estimar adecuadamente el impacto del programa.
Es necesario tener presente algunas desventajas de este método:
Supone la existencia de información para un grupo de comparación en
la línea basal como después del programa.
▶ Supone que la correlación del efecto no observado y la decisión de participar es constante en el tiempo (es un efecto fijo).
▶ Supone que la relación entre las variables es lineal y finalmente que el
impacto del programa es una constante fija α para todos los participantes.
▶
Impacto del Programa
De todas formas es posible relajar estos criterios:
(1) No es necesario tener información del MISMO control antes y después,
es posible tener dos muestras de aleatorias de la MISMA POBLACIÓN
de controles antes y después, y luego proceder a localizar para cada participante una combinación de controles adecuados. Este procedimiento
se conoce como “Matching”.
(2) Esto también permite controlar por diferencias no observadas que cambian en el tiempo a condición que las diferencias en los no observables
ENTRE ambos grupos sea constante.
(3) Los métodos de Matching son de una naturaleza no paramétrica, de
forma que no exigen de contar con supuesto de linealidad.
(4) Como este método compara cada participante con un conjunto de controles que son los más adecuados para reconstruir su contrafactual,
permite incorporar heterogeneidad a los resultados.
Estimador de Matching de Diferencias en Diferencias
Este compara los cambios en resultados para los participantes a los
cambios en resultados para miembros del grupo de control.
El cambio se mide en relación a alguna situación benchmark pre-programa.
Este estimador tiene la ventaja de permitir remover cualquier diferencia
no observable tiempo-invariante entre los individuos de ambos grupos.
Se requerirán datos de corte transversal sobre participantes y no participantes.
Estimador de Matching de Diferencias en Diferencias
Definamos t y t ′ a dos períodos de tiempo, uno después de la fecha de
partida del programa y otro antes, respectivamente.
Yot es el resultado observado en el momento t.
Pensemos que indica situación ocupacional, serán condiciones necesarias
para aplicar este método:
“Condicionando en la probabilidad de participar de las personas, el crecimiento promedio en las posibilidad de empleo del grupo de control
es equivalente al que hubiera tenido el grupo participante si no hubiera
participado”
E[y0t − y0t ′ |P(X ), D = 1] = E[y0t − y0t ′ |P(X ), D = 0]
“Que para cada participante exista al menos un control”:
0 < Pr (D = 1|x) < 1
Estimador de Matching de Diferencias en Diferencias
Bajo estas condiciones el estimador del impacto del programa sobre los
participantes será
ˆ DID = n−1
∆
T =1
1t
n1t
h
i
b 0ti |P(xi ), Di = 0)
y1ti (xi ) − E(y
∑
i=1 Di =1
n1t ′
h
i
−1
b 0t ′ j |P(xj ), Dj = 0) ,
− n1t
y0t ′ j (xj ) − E(y
′
j=1 Dj =1
∑
donde n1t y n1t ′ son el número de observaciones para cada periodo.
La clave del método de estimación está en la construcción del estimador
b 0ti | Pr(xi ), Ti = 0] y de E[y
b 0jt ′ | Pr(xj ), Tj = 0]
de E[y
Estimador de Matching de Diferencias en Diferencias
Se puede demostrar que criterios de matching no paramétricos como el
promedio simple de los controles más parecidos (simple average nearst
neighbor estimators), o basados en una regresión no paramétrica (kernel
regression matching estimator), producen los ponderadores más adecuados para obtener:
n0
b 0ti | Pr(xi ), Ti = 0] = ∑ Wj (P(xi ))Y0j
E[y
j=1
Estimador de Matching de Diferencias en Diferencias
Esta metodología puede extenderse en otras dimensiones, tales como
determinar por ejemplo otros indicadores de impacto tan o quizás más
relevantes que el impacto promedio, por ejemplo:
(a) La proporción de personas que habiendo tomado el programa se benefició
del mismo:
Pr(Y1 > Y0 |D = 1) = Pr(∆|D = 1)
Este indicador es de interés para medir cuán ampliamente las ganancias
del programa se distribuyen entre los participantes.
▶ En presencia de preferencias sobre la distribución de los resultados del
programa, probablemente no le asignarían el mismo peso a dos programa
con el mismo resultado promedio, pero con uno de ello favoreciendo a
sólo un número reducido de personas.
▶
Estimador de Matching de Diferencias en Diferencias
(b) La proporción de la población total que se ha beneficiado de la participación en el programa:
Pr(Y1 > Y0 |D = 1). Pr(D = 1) = Pr(∆|D = 1). Pr(D = 1)
Es el mismo que el anterior pero expandido a todo el universo.
Este indicador permite indagar cuán ampliamente difundidos en la sociedad están los resultado del programa.
▶ Esto permite indagar en qué medida el programa está favoreciendo o no
la constitución de grupos de interés.
▶
▶
(c) La distribución de las ganancias del programa a valores seleccionados del
estado base:
F (∆|D = 1, Y0 = y0 )
▶
Este indicador es importante si existe interés por parte del evaluador por
medir resultados en un grupo especialmente vulnerable.
Estimador de Matching de Diferencias en Diferencias
(d) El incremento en el nivel de los ingresos por encima de un cierto umbral
debido al programa:
Pr(Y1 > ȳ |D = 1) − Pr(Y0 > ȳ |D = 1)
▶
Este estimador permite responder a la pregunta acerca de si las distribuciones de ganancias para los participantes domina la distribución de los
resultados si ellos no hubieran participado.
Análisis de Costo Beneficio
El análisis costos-beneficio, pasa por determinar cuál es la ganancia para la
economía de la existencia del programa a un determinado nivel de
“esfuerzo” ϕ, en relación a la situación donde el programa se deja de
aplicar, es decir ϕ = 0.
Análisis de Costo Beneficio
El beneficio vendrá dado por:
B(ϕ) = [N1 (ϕ)E (Y1 |D = 1, ϕ) + N0 (ϕ)E (Y0 |D = 0, ϕ) − c(ϕ)]
− [N1 (0)E (Y1 |D = 1, 0) + N0 (0)E (Y0 |D = 0, ϕ = 0)] ,
donde:
N1 (ϕ) son los participante en el programa cuando se implemente al nivel
de esfuerzo ϕ.
▶ N (ϕ) son los no participantes cuando el programa se implementa al
0
nivel de esfuerzo ϕ.
▶ E[Y |D = 1, ϕ] es el ingreso promedio de los participantes cuando el
1
programa se implementa al nivel de esfuerzo ϕ.
▶ E[Y |D = 0, ϕ] ingreso promedio de los no participantes cuando el pro0
grama se implementa al nivel de esfuerzo ϕ.
▶ c(ϕ) es el costo del programa asociado al nivel de esfuerzo establecido.
▶
Análisis de Costo Beneficio
ϕ = 0 es el caso de ausencia de programa, por ende N1 (0) = 0 y N0 (0) =
N, que es el total de la población.
Si B(ϕ) > 0, entonces el producto total se incrementa por el establecimiento del programa al nivel ϕ.
En el caso especial donde el resultado en el estado benchmark “0” es el
mismo si o no el programa existe:
E[Y0 |D = 0, ϕ] = E[Y0 |D = 0, 0]
No existirán efectos de equilibrio general en el estado base, de forma
que el estado “no programa” de los no participantes es igual al estado
de no participación.
▶
Al asumir este supuesto podemos generalizar desde el equilibrio parcial
el equilibrio general.
Análisis de Costo Beneficio
Teniendo en cuenta que N = N1 (ϕ) + N0 (ϕ), más la condición anterior,
se obtiene que:
B(ϕ) = N1 (ϕ)E[Y1 − Y0 |D = 1, ϕ] − c(ϕ)
Si se supone que es posible una redistribución sin costos de los beneficios, maximizar sobre ϕ la expresión anterior, maximiza el bienestar
social.
Para este caso importante, el cuál se aplica a programas sociales de
pequeña escala con participación parcial, la medición del impacto de
programa como lo hemos hecho, multiplicado por el número de participantes y restando los costos, es un indicador adecuado de su rentabilidad.
0
You can add this document to your study collection(s)
Sign in Available only to authorized usersYou can add this document to your saved list
Sign in Available only to authorized users(For complaints, use another form )