2  Estacionariedad, autocovarianza y modelos autorregresivos

CA-0415 Series de Tiempo — Semana 2

2.1 Objetivos de aprendizaje

Al finalizar este capítulo, se espera que el estudiantado pueda:

  1. distinguir entre estacionariedad estricta y estacionariedad débil o de segundo orden;
  2. definir e interpretar la función de autocovarianza y la función de autocorrelación de un proceso estacionario;
  3. reconocer el ruido blanco como un proceso sin dependencia lineal serial y distinguir incorrelación de independencia;
  4. derivar la media, la varianza y la función de autocorrelación de un modelo AR(1) estacionario;
  5. interpretar el parámetro autorregresivo \(\phi\) en términos de persistencia, alternancia y reversión hacia la media;
  6. formular un modelo AR(\(p\)), construir su polinomio autorregresivo e interpretar la condición de raíces asociada a la estacionariedad;
  7. explicar el papel de la función de autocorrelación parcial (PACF) en la identificación preliminar del orden de un modelo AR;
  8. derivar la media y la varianza predictivas a horizonte \(h\) para un AR(1) con parámetros conocidos;
  9. comparar propiedades teóricas con simulaciones reproducibles y con funciones de autocorrelación muestrales;
  10. utilizar ACF y PACF como herramientas exploratorias sin confundirlas con un procedimiento automático de selección de modelos.

En Sección 1.2 distinguimos el proceso aleatorio \(\{Y_t\}\) de una realización observada \(y_{1:T}\), y en Sección 1.5 definimos el pronóstico como una distribución condicional dada la información disponible. Esta semana damos el siguiente paso: necesitamos describir de manera probabilística cómo depende una observación de otras observaciones de la misma serie y bajo qué condiciones esa estructura permanece estable cuando desplazamos el origen temporal.

2.2 De la exploración gráfica a una estructura probabilística

En la semana anterior aprendimos a reconocer tendencia, estacionalidad, cambios de variabilidad y observaciones inusuales. Esas características son útiles para formular hipótesis, pero no bastan para responder preguntas como las siguientes:

  • ¿qué significa que dos observaciones separadas por \(h\) períodos estén relacionadas?;
  • ¿cómo cambia esa relación cuando aumenta \(h\)?;
  • ¿cuándo podemos resumir la dependencia usando únicamente la separación temporal y no las fechas específicas?;
  • ¿qué tipo de dependencia produce una trayectoria persistente, y qué tipo produce alternancia?;
  • ¿cómo se traduce la dependencia temporal en un pronóstico?

La idea de estacionariedad introduce una forma de regularidad probabilística que permite contestar estas preguntas. Shumway y Stoffer subrayan que esta regularidad es fundamental cuando se dispone de una sola trayectoria temporal, pues permite tratar pares de observaciones separados por el mismo rezago como manifestaciones de una misma estructura de dependencia (Shumway y Stoffer 2025, sec. 1.4). Prado, Ferreira y West presentan la misma idea como invariancia del comportamiento probabilístico frente a desplazamientos temporales (Prado et al. 2021, sec. 1.2).

2.3 Procesos estacionarios

2.3.1 Estacionariedad estricta

Un proceso \(\{Y_t:t\in\mathcal T\}\) es estrictamente estacionario si, para cualquier \(k\geq 1\), cualquier colección de tiempos \(t_1,\ldots,t_k\) y cualquier desplazamiento \(h\) compatible con el índice temporal,

\[ (Y_{t_1},\ldots,Y_{t_k}) \overset{d}{=} (Y_{t_1+h},\ldots,Y_{t_k+h}). \tag{2.1}\]

La igualdad en distribución de Ecuación 2.1 exige que todas las distribuciones finito-dimensionales permanezcan invariantes al desplazar el tiempo. En particular, si existen los momentos correspondientes, la media, la varianza, la asimetría y cualquier otra característica marginal no dependen del punto del calendario en que observamos el proceso (Prado et al. 2021, sec. 1.2; Shumway y Stoffer 2025, Definition 1.6).

Esta definición es conceptualmente limpia, pero en aplicaciones resulta difícil verificar toda la distribución conjunta. Por ello, gran parte de la teoría clásica trabaja con una noción más débil basada en los dos primeros momentos.

2.3.2 Estacionariedad débil o de segundo orden

Un proceso con segundos momentos finitos es débilmente estacionario, o estacionario de segundo orden, si existe una constante \(\mu\) tal que

\[ E(Y_t)=\mu \tag{2.2}\]

para todo \(t\), y si

\[ \operatorname{Cov}(Y_t,Y_s) \]

depende de \(t\) y \(s\) únicamente a través de su separación temporal. Para una serie indexada en enteros escribiremos

\[ \gamma(h) = \operatorname{Cov}(Y_t,Y_{t-h}), \qquad h=0,\pm1,\pm2,\ldots \tag{2.3}\]

La media es constante y la estructura de segundo orden es invariante frente a traslaciones temporales. Esta es la definición operativa que utilizaremos en buena parte del curso (Prado et al. 2021, sec. 1.2; Shumway y Stoffer 2025, sec. 1.4).

NotaEstricta y débil no significan lo mismo

Si los primeros dos momentos existen, la estacionariedad estricta implica estacionariedad débil. La implicación inversa no vale en general. En un proceso gaussiano, en cambio, la distribución conjunta queda determinada por la media y la covarianza, por lo que estacionariedad débil y estricta coinciden (Prado et al. 2021, sec. 1.2).

Tabla 2.1: Comparación entre las nociones de estacionariedad utilizadas en el capítulo.
Concepto Requisito principal Consecuencia
Estricta Invariancia de todas las distribuciones finito-dimensionales ante desplazamientos temporales Toda característica distribucional es estable en el tiempo
Débil o de segundo orden Media constante y covarianza dependiente solo del rezago La dependencia lineal puede resumirse mediante \(\gamma(h)\) y \(\rho(h)\)
Gaussiana estacionaria Proceso gaussiano y estacionariedad de segundo orden La invariancia de media y covarianza determina la invariancia distribucional

2.3.3 Un contraejemplo fundamental: la caminata aleatoria

Considere

\[ Y_t=Y_{t-1}+\varepsilon_t, \tag{2.4}\]

con innovaciones de media cero, varianza \(\sigma_\varepsilon^2\) y mutuamente no-correlacionadas. Si \(Y_0\) tiene varianza finita e independiente de las innovaciones, entonces

\[ Y_t=Y_0+\sum_{j=1}^{t}\varepsilon_j, \]

y por tanto

\[ \operatorname{Var}(Y_t) = \operatorname{Var}(Y_0)+t\sigma_\varepsilon^2. \tag{2.5}\]

La varianza en Ecuación 2.5 cambia con \(t\), de modo que la caminata aleatoria no es débilmente estacionaria. Shumway y Stoffer utilizan precisamente este ejemplo para mostrar que una serie puede tener una estructura temporal sencilla y, sin embargo, violar la estacionariedad porque su varianza depende del tiempo (Shumway y Stoffer 2025, Example 1.22).

set.seed(415)
n <- 200

ar_estacionario <- as.numeric(stats::arima.sim(
  model = list(ar = 0.7),
  n = n,
  sd = 1
))

caminata <- cumsum(rnorm(n))

comparacion_estacionariedad <- tibble(
  t = rep(seq_len(n), 2),
  valor = c(ar_estacionario, caminata),
  Proceso = rep(c("AR(1), φ = 0.7", "Caminata aleatoria"), each = n)
)

ggplot(comparacion_estacionariedad, aes(x = t, y = valor)) +
  geom_line() +
  facet_wrap(~Proceso, ncol = 1, scales = "free_y") +
  labs(
    x = "Tiempo",
    y = NULL,
    title = "Regularidad alrededor de un nivel frente a acumulación de choques"
  )
Dos paneles. El primero muestra una serie AR(1) que fluctúa alrededor de un nivel estable; el segundo muestra una caminata aleatoria cuya dispersión y nivel cambian a lo largo del tiempo.
Figura 2.1: Contraste entre una realización estacionaria AR(1) y una caminata aleatoria.

La Figura 2.1 es ilustrativa, no una prueba de estacionariedad. Una sola trayectoria puede engañarnos: la propiedad se refiere al proceso generador, no a que un gráfico particular “se vea estable”.

ImportanteEstacionariedad es una propiedad probabilística, no un aspecto visual

Una gráfica puede sugerir que la media o la variabilidad cambian, pero la estacionariedad no se define por inspección visual. Del mismo modo, una realización corta de un proceso no estacionario puede parecer relativamente estable. Los gráficos motivan preguntas; la definición se formula en términos de distribuciones o momentos.

2.4 Autocovarianza y autocorrelación

Para un proceso débilmente estacionario, la función de autocovarianza se definió en Ecuación 2.3. Como \(\gamma(0)=\operatorname{Var}(Y_t)\), podemos estandarizar la autocovarianza y obtener la función de autocorrelación, o ACF:

\[ \rho(h) = \frac{\gamma(h)}{\gamma(0)}, \qquad h=0,\pm1,\pm2,\ldots \tag{2.6}\]

La ACF mide asociación lineal entre observaciones separadas por \(h\) períodos (Prado et al. 2021, sec. 1.3; Shumway y Stoffer 2025, sec. 1.3). En particular,

\[ \rho(0)=1, \qquad -1\leq \rho(h)\leq 1. \]

2.4.1 Propiedades de la autocovarianza

Para un proceso estacionario real,

\[ \gamma(-h)=\gamma(h). \tag{2.7}\]

En efecto,

\[ \begin{aligned} \gamma(-h) &=\operatorname{Cov}(Y_t,Y_{t+h})\\ &=\operatorname{Cov}(Y_{t+h},Y_t)\\ &=\gamma(h). \end{aligned} \]

Además, por la desigualdad de Cauchy–Schwarz,

\[ |\gamma(h)| \leq \sqrt{\operatorname{Var}(Y_t)\operatorname{Var}(Y_{t-h})} = \gamma(0), \tag{2.8}\]

lo que conduce inmediatamente a \(|\rho(h)|\leq1\). La función de autocovarianza también debe ser no negativa definida; esta propiedad garantiza que la varianza de cualquier combinación lineal finita de observaciones sea no negativa (Shumway y Stoffer 2025, sec. 1.4).

AdvertenciaCorrelación cero no significa independencia

Si \(\rho(h)=0\), entonces \(Y_t\) y \(Y_{t-h}\) no presentan asociación lineal de segundo orden, pero pueden seguir siendo dependientes. Independencia implica correlación cero cuando existen segundos momentos; la inversa requiere condiciones adicionales. En el caso gaussiano, no-correlación e independencia sí coinciden para pares de variables.

2.4.2 De la ACF poblacional a la ACF muestral

La ACF teórica pertenece al proceso \(\{Y_t\}\). En los datos observamos únicamente \(y_{1:T}\), por lo que debemos estimarla. Una convención común para el estimador de la autocovarianza es

\[ \widehat\gamma(h) = \frac{1}{T} \sum_{t=1}^{T-h} (y_{t+h}-\bar y)(y_t-\bar y), \qquad h=0,1,\ldots, \tag{2.9}\]

con

\[ \bar y=\frac{1}{T}\sum_{t=1}^{T}y_t. \]

La ACF muestral es

\[ \widehat\rho(h) = \frac{\widehat\gamma(h)}{\widehat\gamma(0)}. \tag{2.10}\]

Prado, Ferreira y West utilizan la forma de Ecuación 2.9 y enfatizan que la ACF muestral es una estimación, por lo que fluctúa de una realización a otra (Prado et al. 2021, sec. 1.3).

NotaLas bandas de una ACF no son una prueba general de estacionariedad

Bajo ruido blanco y para muestras suficientemente largas, una referencia aproximada para autocorrelaciones muestrales individuales es \(\pm1.96/\sqrt{T}\). Estas bandas son útiles como guía exploratoria, pero no constituyen una prueba universal de que un proceso sea ruido blanco, estacionario o de un orden AR específico. La inferencia y el diagnóstico formal se desarrollarán en semanas posteriores.

2.5 Ruido blanco

El ruido blanco es el bloque de construcción de gran parte de los modelos del curso. Escribiremos

\[ \varepsilon_t\sim WN(0,\sigma_\varepsilon^2) \]

para indicar que

\[ E(\varepsilon_t)=0, \qquad \operatorname{Var}(\varepsilon_t)=\sigma_\varepsilon^2, \]

y

\[ \operatorname{Cov}(\varepsilon_t,\varepsilon_s)=0, \qquad t\neq s. \tag{2.11}\]

Por tanto,

\[ \gamma_\varepsilon(h) = \begin{cases} \sigma_\varepsilon^2, & h=0,\\ 0, & h\neq0, \end{cases} \qquad \rho_\varepsilon(h) = \begin{cases} 1, & h=0,\\ 0, & h\neq0. \end{cases} \tag{2.12}\]

Shumway y Stoffer definen el ruido blanco a partir de variables no-correlacionadas de media cero y varianza constante, y distinguen explícitamente esta condición del ruido blanco independiente y del ruido blanco gaussiano (Shumway y Stoffer 2025, Example 1.9). Prado, Ferreira y West utilizan el ruido blanco gaussiano como el ejemplo más sencillo de un proceso con ACF nula en todos los rezagos distintos de cero (Prado et al. 2021, Example 1.1).

ImportanteRuido blanco no significa necesariamente i.i.d.

La definición de segundo orden exige no-correlación, no independencia. Cuando sea necesario suponer independencia o normalidad lo indicaremos explícitamente. Esta distinción será especialmente importante cuando estudiemos modelos de volatilidad, donde una serie puede tener autocorrelación lineal casi nula y, sin embargo, presentar dependencia en su magnitud o en sus cuadrados.

2.6 El modelo AR(1)

El modelo autorregresivo de primer orden será nuestro ejemplo conductor. Escribimos

\[ Y_t=c+\phi Y_{t-1}+\varepsilon_t, \qquad \varepsilon_t\sim WN(0,\sigma_\varepsilon^2). \tag{2.13}\]

El término autorregresivo refleja que la variable en el tiempo \(t\) depende linealmente de su propio valor en el período anterior. Para la representación causal y estacionaria usual del modelo se requiere

\[ |\phi|<1. \tag{2.14}\]

Esta condición tiene dos consecuencias fundamentales. Primero, el efecto de las condiciones iniciales y de perturbaciones ocurridas en el pasado disminuye con el tiempo. Segundo, la dependencia entre observaciones separadas por varios períodos también disminuye geométricamente. Ambas propiedades provienen de la misma potencia \(\phi^h\).

2.6.1 ¿Por qué \(|\phi|<1\) conduce a una solución estacionaria?

Supongamos inicialmente que el proceso posee una media constante \(\mu\). Tomando esperanza en Ecuación 2.13,

\[ \mu=c+\phi\mu, \]

por lo que, siempre que \(\phi\neq 1\),

\[ \mu=\frac{c}{1-\phi}. \tag{2.15}\]

Resulta conveniente centrar el proceso alrededor de esta media. Definimos

\[ X_t=Y_t-\mu. \]

Usando \(c=(1-\phi)\mu\), el modelo AR(1) puede escribirse como

\[ X_t=\phi X_{t-1}+\varepsilon_t. \tag{2.16}\]

Ahora iteramos la ecuación hacia atrás. Sustituyendo una vez,

\[ X_t = \phi(\phi X_{t-2}+\varepsilon_{t-1}) +\varepsilon_t = \phi^2X_{t-2} +\phi\varepsilon_{t-1} +\varepsilon_t. \]

Después de \(k\) sustituciones obtenemos

\[ X_t = \phi^kX_{t-k} + \sum_{j=0}^{k-1}\phi^j\varepsilon_{t-j}. \tag{2.17}\]

La primera parte de Ecuación 2.17 contiene toda la influencia de la condición existente \(k\) períodos atrás. Si \(|\phi|<1\), entonces

\[ \phi^k\longrightarrow 0 \qquad\text{cuando}\qquad k\longrightarrow\infty. \]

Por tanto, al alejarnos suficientemente hacia el pasado, el efecto de \(X_{t-k}\) desaparece. Esto conduce a la representación

\[ X_t = \sum_{j=0}^{\infty}\phi^j\varepsilon_{t-j}, \]

o, equivalentemente,

\[ Y_t = \mu+ \sum_{j=0}^{\infty}\phi^j\varepsilon_{t-j}. \tag{2.18}\]

La serie de Ecuación 2.18 está bien definida en segundo momento porque

\[ \sum_{j=0}^{\infty}\phi^{2j} = \frac{1}{1-\phi^2} <\infty \]

cuando \(|\phi|<1\). En particular,

\[ E(Y_t)=\mu \]

para todo \(t\), y

\[ \begin{aligned} \operatorname{Var}(Y_t) &= \operatorname{Var} \left( \sum_{j=0}^{\infty}\phi^j\varepsilon_{t-j} \right)\\ &= \sigma_\varepsilon^2 \sum_{j=0}^{\infty}\phi^{2j}\\ &= \frac{\sigma_\varepsilon^2}{1-\phi^2}. \end{aligned} \tag{2.19}\]

La media y la varianza, por tanto, no dependen de \(t\). Falta comprobar que la covarianza entre dos observaciones depende únicamente de la distancia temporal que las separa. Esto se obtiene directamente de la estructura autorregresiva.

Para \(h\geq 1\), iterando Ecuación 2.16 \(h\) pasos,

\[ X_t = \phi^h X_{t-h} + \sum_{j=0}^{h-1}\phi^j\varepsilon_{t-j}. \tag{2.20}\]

Las innovaciones \(\varepsilon_t,\varepsilon_{t-1},\ldots,\varepsilon_{t-h+1}\) no están correlacionadas con \(X_{t-h}\), pues \(X_{t-h}\) depende únicamente de innovaciones ocurridas hasta el tiempo \(t-h\). Por consiguiente,

\[ \begin{aligned} \gamma(h) &= \operatorname{Cov}(X_t,X_{t-h})\\ &= \operatorname{Cov} \left( \phi^hX_{t-h} + \sum_{j=0}^{h-1}\phi^j\varepsilon_{t-j}, X_{t-h} \right)\\ &= \phi^h\operatorname{Var}(X_{t-h})\\ &= \phi^h\gamma(0). \end{aligned} \]

Como la función de autocovarianza es simétrica, \(\gamma(-h)=\gamma(h)\), podemos escribir para cualquier rezago entero \(h\)

\[ \gamma(h) = \frac{\sigma_\varepsilon^2}{1-\phi^2} \phi^{|h|}. \tag{2.21}\]

Así, la media es constante, la varianza es constante y la autocovarianza depende únicamente del rezago \(h\), no del tiempo \(t\). Por ello, Ecuación 2.18 define una solución débilmente estacionaria del AR(1).

Si además las innovaciones son independientes e idénticamente distribuidas, la representación como función de una secuencia infinita de innovaciones pasadas proporciona una solución estrictamente estacionaria. En particular, si las innovaciones son gaussianas, la estacionariedad débil implica también estacionariedad estricta.

2.6.2 ¿Por qué la ACF decae geométricamente?

Dividiendo Ecuación 2.21 entre \(\gamma(0)=\sigma_\varepsilon^2/(1-\phi^2)\) obtenemos

\[ \rho(h)=\phi^{|h|}. \tag{2.22}\]

Por tanto,

\[ \rho(1)=\phi,\qquad \rho(2)=\phi^2,\qquad \rho(3)=\phi^3,\quad\ldots \]

y, en valor absoluto,

\[ |\rho(h+1)| = |\phi|\,|\rho(h)|. \tag{2.23}\]

Esta última expresión explica qué significa que la ACF decae geométricamente: al aumentar el rezago en una unidad, la magnitud de la autocorrelación anterior se multiplica por el mismo factor \(|\phi|<1\).

El signo de \(\phi\) determina la forma del decaimiento:

  • si \(0<\phi<1\), todas las autocorrelaciones son positivas y disminuyen monótonamente hacia cero;
  • si \(-1<\phi<0\), las autocorrelaciones alternan de signo, aunque su magnitud continúa disminuyendo geométricamente;
  • si \(|\phi|\) está cerca de cero, la dependencia desaparece rápidamente;
  • si \(|\phi|\) está cerca de uno, la ACF decae lentamente y el proceso muestra una alta persistencia.

Por ejemplo, si \(\phi=0.5\),

\[ \rho(1)=0.5,\qquad \rho(2)=0.25,\qquad \rho(3)=0.125, \]

mientras que para \(\phi=0.9\),

\[ \rho(1)=0.9,\qquad \rho(2)=0.81,\qquad \rho(3)=0.729. \]

En ambos casos la ACF converge a cero, pero lo hace mucho más lentamente cuando \(\phi=0.9\). Esta es la razón por la que un AR(1) con \(\phi\) cercano a uno puede producir trayectorias que visualmente parecen tener una memoria muy larga, aun cuando el proceso siga siendo estacionario.

La condición \(|\phi|<1\) también puede expresarse mediante el polinomio autorregresivo

\[ \Phi(z)=1-\phi z. \]

Su única raíz es \(z=1/\phi\). Por tanto,

\[ |\phi|<1 \quad\Longleftrightarrow\quad \left|\frac{1}{\phi}\right|>1, \]

es decir, la raíz de \(\Phi(z)\) se encuentra fuera del círculo unitario. Esta formulación será la que utilizaremos posteriormente para generalizar la condición de estacionariedad a modelos AR(\(p\)) (Prado et al. 2021; Shumway y Stoffer 2025).

2.7 Simulación: interpretar el parámetro \(\phi\)

Para que las simulaciones no dependan de objetos creados previamente, definimos una función sencilla que implementa directamente la recursión AR(1). Para \(|\phi|<1\) inicializamos aproximadamente desde la distribución estacionaria cuando las innovaciones son gaussianas.

simular_ar1 <- function(phi, n, mu = 0, sigma = 1) {
  stopifnot(
    length(phi) == 1,
    n >= 2,
    sigma > 0,
    abs(phi) < 1
  )

  y <- numeric(n)
  y[1] <- rnorm(
    1,
    mean = mu,
    sd = sigma / sqrt(1 - phi^2)
  )

  innovaciones <- rnorm(n - 1, mean = 0, sd = sigma)

  for (t in 2:n) {
    y[t] <- mu + phi * (y[t - 1] - mu) + innovaciones[t - 1]
  }

  y
}

2.7.1 Persistencia positiva y alternancia

set.seed(415)
phis <- c(0.3, 0.9, -0.9)
n_sim <- 180

simulaciones_ar1 <- map_dfr(
  phis,
  ~ tibble(
    t = seq_len(n_sim),
    y = simular_ar1(.x, n = n_sim),
    phi = factor(
      .x,
      levels = phis,
      labels = c("φ = 0.3", "φ = 0.9", "φ = -0.9")
    )
  )
)

ggplot(simulaciones_ar1, aes(x = t, y = y)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_line() +
  facet_wrap(~phi, ncol = 1) +
  labs(
    x = "Tiempo",
    y = "Y_t",
    title = "El parámetro autorregresivo controla la memoria de corto plazo"
  )
Tres paneles de trayectorias AR(1). Con phi 0.3 la persistencia es baja, con phi 0.9 aparecen excursiones prolongadas, y con phi menos 0.9 los signos alternan con frecuencia.
Figura 2.2: Trayectorias AR(1) simuladas para distintos valores de \(\phi\).

La Figura 2.2 muestra tres comportamientos:

  1. con \(\phi=0.3\), los choques desaparecen relativamente rápido;
  2. con \(\phi=0.9\), una desviación respecto de la media tiende a persistir durante varios períodos;
  3. con \(\phi=-0.9\), la serie tiende a alternar alrededor de la media porque correlaciones de rezago impar son negativas y las de rezago par son positivas.

2.7.2 ACF teórica

acf_teorica <- crossing(
  phi = phis,
  h = 0:30
) |>
  mutate(
    rho = phi^h,
    phi = factor(
      phi,
      levels = phis,
      labels = c("φ = 0.3", "φ = 0.9", "φ = -0.9")
    )
  )

ggplot(acf_teorica, aes(x = h, y = rho)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_segment(aes(xend = h, yend = 0)) +
  facet_wrap(~phi, ncol = 1) +
  labs(
    x = "Rezago h",
    y = "ρ(h)",
    title = "La ACF de un AR(1) decae geométricamente"
  )
Curvas de autocorrelación teórica para phi 0.3, 0.9 y menos 0.9. La primera cae rápidamente, la segunda lentamente y la tercera alterna signos mientras decae.
Figura 2.3: Funciones de autocorrelación teóricas de tres procesos AR(1).

La Figura 2.3 representa exactamente Ecuación 2.22. La comparación entre \(\phi=0.3\) y \(\phi=0.9\) muestra que la persistencia está controlada por \(|\phi|\), mientras que el signo de \(\phi\) controla la alternancia.

2.7.3 Teoría frente a una ACF muestral

set.seed(415)
phi_demo <- 0.8
T_demo <- 200
y_demo <- simular_ar1(phi_demo, n = T_demo)
lag_max <- 25

acf_empirica <- stats::acf(
  y_demo,
  lag.max = lag_max,
  plot = FALSE,
  demean = TRUE
)

comparacion_acf <- tibble(
  h = 0:lag_max,
  Muestral = as.numeric(acf_empirica$acf),
  Teorica = phi_demo^(0:lag_max)
)

ggplot(comparacion_acf, aes(x = h)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_segment(aes(y = Muestral, xend = h, yend = 0)) +
  geom_point(aes(y = Teorica)) +
  geom_line(aes(y = Teorica)) +
  labs(
    x = "Rezago h",
    y = "Autocorrelación",
    title = "La ACF muestral fluctúa alrededor del patrón poblacional",
    subtitle = "T = 200, φ = 0.8"
  )
Comparación de barras de autocorrelación muestral con puntos y una línea que representan la autocorrelación teórica de un AR(1) con phi 0.8.
Figura 2.4: ACF teórica y ACF muestral de una realización AR(1) con \(\phi=0.8\).

En la Figura 2.4 la forma general coincide con la teoría, pero no cada barra. Esta variabilidad es importante: identificar un modelo a partir de la ACF es un problema estadístico, no una comparación exacta de dibujos.

2.7.4 Media y varianza empíricas

Tabla 2.2: Comparación de momentos empíricos y teóricos en simulaciones AR(1) largas.
phi Media empírica Media teórica Varianza empírica Varianza teórica
0.3 -0.015 0 1.121 1.099
0.9 -0.212 0 4.872 5.263
-0.9 -0.002 0 5.465 5.263

La Tabla 2.2 no constituye una demostración, pero sirve como control computacional de Ecuación 2.15 y Ecuación 2.19.

2.8 Cerca de una raíz unitaria

Cuando \(\phi\) se aproxima a uno desde abajo, la ACF decae lentamente y la varianza marginal \(\sigma_\varepsilon^2/(1-\phi^2)\) crece. Esto produce trayectorias con excursiones largas que visualmente pueden parecer no estacionarias. En el límite \(\phi=1\) obtenemos la caminata aleatoria de Ecuación 2.4.

set.seed(415)
n_casi <- 250

casi_unitaria <- simular_ar1(0.99, n = n_casi)
random_walk <- cumsum(rnorm(n_casi))

comparacion_raiz <- tibble(
  t = rep(seq_len(n_casi), 2),
  y = c(casi_unitaria, random_walk),
  Modelo = rep(
    c("AR(1), φ = 0.99", "Caminata aleatoria, φ = 1"),
    each = n_casi
  )
)

ggplot(comparacion_raiz, aes(x = t, y = y)) +
  geom_line() +
  facet_wrap(~Modelo, ncol = 1, scales = "free_y") +
  labs(
    x = "Tiempo",
    y = NULL,
    title = "Persistencia extrema no es lo mismo que una raíz unitaria"
  )
Dos paneles. El primero muestra una serie muy persistente con phi 0.99 que aún revierte lentamente hacia su media; el segundo muestra una caminata aleatoria con phi igual a uno.
Figura 2.5: Un AR(1) con \(\phi=0.99\) comparado con una caminata aleatoria.

La Figura 2.5 también anticipa una dificultad inferencial: con muestras cortas puede ser difícil distinguir empíricamente entre persistencia muy alta y una raíz unitaria. Las pruebas de raíz unitaria y la diferenciación se estudiarán en la semana dedicada a ARIMA.

2.9 Modelos AR(\(p\))

Un modelo autorregresivo de orden \(p\) extiende Ecuación 2.13 a varios rezagos:

\[ Y_t = c+\phi_1Y_{t-1}+\cdots+\phi_pY_{t-p}+\varepsilon_t, \tag{2.24}\]

con \(\varepsilon_t\sim WN(0,\sigma_\varepsilon^2)\). Si el proceso tiene media \(\mu\), puede escribirse como

\[ Y_t-\mu = \phi_1(Y_{t-1}-\mu) +\cdots+ \phi_p(Y_{t-p}-\mu) +\varepsilon_t, \tag{2.25}\]

con

\[ \mu = \frac{c}{1-\phi_1-\cdots-\phi_p}, \tag{2.26}\]

si el denominador es distinto de cero y los parámetros pertenecen a la región estacionaria.

2.9.1 Polinomio autorregresivo y raíces

Definimos el polinomio autorregresivo

\[ \Phi(z) = 1-\phi_1z-\cdots-\phi_pz^p. \tag{2.27}\]

En la formulación estándar de un AR estacionario construido a partir de innovaciones no anticipativas, las raíces de

\[ \Phi(z)=0 \]

deben estar fuera del círculo unitario. Equivalentemente, los recíprocos de esas raíces tienen módulo menor que uno. Prado, Ferreira y West utilizan estos recíprocos para describir la estructura de un AR(\(p\)), su ACF y la forma de su función de pronóstico (Prado et al. 2021, secs. 2.1.1–2.1.4).

NotaEstacionariedad y causalidad se separarán con más cuidado en la semana 3

La condición de raíces está íntimamente relacionada con la posibilidad de expresar el proceso usando innovaciones presentes y pasadas. Esa propiedad se denomina causalidad. En este capítulo utilizamos la convención estándar del modelo AR estacionario; la distinción formal entre estacionariedad, causalidad e invertibilidad se desarrollará al estudiar modelos ARMA.

2.9.2 El caso AR(2)

Para

\[ Y_t = \phi_1Y_{t-1}+\phi_2Y_{t-2}+\varepsilon_t, \tag{2.28}\]

la región estacionaria puede escribirse como

\[ -1<\phi_2<1, \qquad \phi_1<1-\phi_2, \qquad \phi_1>\phi_2-1. \tag{2.29}\]

Prado, Ferreira y West muestran que las raíces reales producen combinaciones de decaimientos exponenciales, mientras que un par de raíces complejas conjugadas produce oscilaciones amortiguadas (Prado et al. 2021, secs. 2.1.3–2.1.4). El ejemplo \(\phi_1=1.5\), \(\phi_2=-0.75\) pertenece a la región estacionaria y genera una estructura cuasiperiódica.

2.9.3 El papel de las raíces en un AR(2)

Considere nuevamente el proceso estacionario

\[ Y_t=\phi_1Y_{t-1}+\phi_2Y_{t-2}+\varepsilon_t, \qquad \varepsilon_t\sim WN(0,\sigma_\varepsilon^2). \]

Una de las características más importantes del AR(2) es que la forma de su dependencia temporal está determinada por las raíces de una ecuación cuadrática. Para ver esto, no es necesario comenzar directamente con las trayectorias del proceso: podemos estudiar primero su función de autocorrelación.

Para un AR(2) estacionario:

\[ \rho(h) = \phi_1\rho(h-1)+\phi_2\rho(h-2), \qquad h\geq 2. \tag{2.30}\]

Las condiciones iniciales son

\[ \rho(0)=1 \]

y

\[ \rho(1) = \frac{\phi_1}{1-\phi_2}. \tag{2.31}\]

Por tanto, la ACF satisface una ecuación en diferencias lineal homogénea de segundo orden. Para estudiar su forma, buscamos soluciones de la forma

\[ \rho(h)=r^h. \]

Sustituyendo en Ecuación 2.30,

\[ r^h = \phi_1r^{h-1}+\phi_2r^{h-2}. \]

Dividiendo entre \(r^{h-2}\) obtenemos la ecuación característica

\[ r^2-\phi_1r-\phi_2=0. \tag{2.32}\]

Sus raíces son

\[ r_{1,2} = \frac{\phi_1\pm\sqrt{\phi_1^2+4\phi_2}}{2}. \tag{2.33}\]

Estas raíces están estrechamente relacionadas con las raíces del polinomio autorregresivo

\[ \Phi(z)=1-\phi_1z-\phi_2z^2. \]

Si \(z_1\) y \(z_2\) son las raíces de \(\Phi(z)=0\), entonces

\[ r_1=\frac{1}{z_1}, \qquad r_2=\frac{1}{z_2}. \]

Así, la condición usual de estacionariedad, según la cual las raíces \(z_1,z_2\) deben encontrarse fuera del círculo unitario,

\[ |z_1|>1, \qquad |z_2|>1, \]

equivale a exigir

\[ |r_1|<1, \qquad |r_2|<1. \]

Esta segunda representación resulta especialmente útil para interpretar la dinámica, porque \(r_1\) y \(r_2\) aparecen elevados al rezago \(h\).

2.9.3.1 Dos raíces reales distintas

Suponga primero que

\[ \phi_1^2+4\phi_2>0. \]

Entonces \(r_1\) y \(r_2\) son reales y distintos, y la solución general de Ecuación 2.30 tiene la forma

\[ \rho(h) = A r_1^h+B r_2^h, \tag{2.34}\]

donde \(A\) y \(B\) se determinan a partir de \(\rho(0)\) y \(\rho(1)\).

Si el proceso es estacionario, \(|r_1|<1\) y \(|r_2|<1\). Por ello,

\[ r_1^h\longrightarrow 0, \qquad r_2^h\longrightarrow 0, \]

cuando \(h\rightarrow\infty\). La ACF es, por tanto, una combinación de dos términos que decaen geométricamente hacia cero.

En tiempo discreto es frecuente llamar a este comportamiento decaimiento exponencial, ya que

\[ |r|^h = \exp\{h\log |r|\}, \]

y \(\log|r|<0\) cuando \(|r|<1\).

El término asociado con la raíz de mayor módulo suele dominar el comportamiento para rezagos grandes. Por ejemplo, si

\[ |r_1|>|r_2|, \]

entonces \(r_2^h\) desaparece más rápidamente y para valores grandes de \(h\)

\[ \rho(h)\approx A r_1^h. \]

Sin embargo, el signo de las raíces también es importante. Si \(r_i>0\), el término \(r_i^h\) conserva su signo; si \(r_i<0\), entonces

\[ r_i^h=(-1)^h|r_i|^h, \]

por lo que alterna de signo entre rezagos pares e impares. En consecuencia, una raíz real negativa puede producir una ACF con cierta alternancia u oscilación, aun cuando su magnitud siga decayendo geométricamente.

2.9.3.2 Una raíz real repetida

Si

\[ \phi_1^2+4\phi_2=0, \]

la ecuación característica posee una raíz real \(r\) de multiplicidad dos. En este caso, la solución ya no tiene simplemente la forma \(Ar^h+Br^h\). La solución general es

\[ \rho(h) = (A+Bh)r^h. \tag{2.35}\]

Mientras \(|r|<1\), la ACF continúa convergiendo a cero. El factor \(h\) modifica la rapidez y la forma del decaimiento, pero la potencia \(r^h\) termina dominando al crecimiento lineal de \(h\).

2.9.3.3 Un par de raíces complejas conjugadas

El caso más interesante ocurre cuando

\[ \phi_1^2+4\phi_2<0. \tag{2.36}\]

Entonces las dos raíces de Ecuación 2.32 son complejas conjugadas. Podemos escribirlas en forma polar como

\[ r_1=r e^{i\omega}, \qquad r_2=r e^{-i\omega}, \tag{2.37}\]

donde \(r>0\) es el módulo de las raíces y \(\omega\) es su argumento.

Para un AR(2),

\[ r=\sqrt{-\phi_2} \tag{2.38}\]

y

\[ \cos(\omega) = \frac{\phi_1}{2r}. \tag{2.39}\]

La solución general basada en las raíces complejas puede escribirse como

\[ \rho(h) = A r_1^h+B r_2^h. \]

Aunque \(r_1\) y \(r_2\) son complejos, la ACF debe ser real. Usando la fórmula de Euler,

\[ e^{i\theta} = \cos(\theta)+i\sin(\theta), \]

la combinación anterior puede escribirse completamente en términos reales:

\[ \rho(h) = r^h \left[ C\cos(\omega h) + D\sin(\omega h) \right]. \tag{2.40}\]

Equivalentemente, para constantes apropiadas \(K\) y \(\delta\),

\[ \rho(h) = K r^h\cos(\omega h+\delta). \tag{2.41}\]

Esta expresión permite separar dos características distintas de la ACF.

El factor

\[ r^h \]

controla la amortiguación. Para un proceso estacionario, \(r<1\), de modo que

\[ r^h\longrightarrow0. \]

Por otra parte,

\[ \cos(\omega h+\delta) \]

genera la oscilación. El parámetro \(\omega\) es la frecuencia angular, y el período asociado, medido en unidades de tiempo, es

\[ \lambda=\frac{2\pi}{\omega}. \tag{2.42}\]

Por ello, un par de raíces complejas conjugadas produce una ACF sinusoidal amortiguada: la correlación cambia repetidamente de signo, pero la amplitud de esas oscilaciones se reduce con el rezago.

La interpretación de \(r\) y \(\omega\) es especialmente útil:

  • \(r\) determina cuánto persisten las oscilaciones;
  • \(\omega\) determina qué tan rápidamente oscilan;
  • \(\lambda=2\pi/\omega\) determina aproximadamente cada cuántos períodos se repite el ciclo.

Si \(r\) está cerca de uno, las oscilaciones desaparecen lentamente. Si \(r\) es pequeño, la componente cíclica se amortigua rápidamente.

Esta es una diferencia importante entre una componente periódica determinista y un AR(2) con raíces complejas. El AR(2) no genera una sinusoide determinista que se repite para siempre. Las innovaciones \(\varepsilon_t\) introducen continuamente nuevos choques aleatorios. Por ello, las trayectorias presentan un comportamiento cuasiperiódico: pueden observarse ciclos de duración aproximadamente \(\lambda\), pero su amplitud y su posición varían aleatoriamente con el tiempo (Prado et al. 2021).

2.9.3.4 Ejemplo: \(\phi_1=1.5\) y \(\phi_2=-0.75\)

Considere

\[ Y_t = 1.5Y_{t-1} - 0.75Y_{t-2} + \varepsilon_t. \]

La ecuación característica asociada a la ACF es

\[ r^2-1.5r+0.75=0. \]

Su discriminante es

\[ 1.5^2-4(0.75) = 2.25-3 = -0.75<0, \]

por lo que las raíces son complejas conjugadas:

\[ r_{1,2} = \frac{1.5\pm i\sqrt{0.75}}{2} = 0.75\pm0.4330i. \]

El módulo de ambas raíces es

\[ r = \sqrt{0.75^2+0.4330^2} = \sqrt{0.75} = \frac{\sqrt{3}}{2} \approx0.866. \]

Como \(r<1\), la componente es estacionaria y las oscilaciones se amortiguan. Además,

\[ \cos(\omega) = \frac{\phi_1}{2r} = \frac{1.5}{2(\sqrt{3}/2)} = \frac{\sqrt{3}}{2}, \]

de modo que

\[ \omega=\frac{\pi}{6}. \]

El período asociado es entonces

\[ \lambda = \frac{2\pi}{\pi/6} = 12. \]

Por tanto, este AR(2) genera una estructura de dependencia con un ciclo característico de aproximadamente 12 períodos, pero cuya intensidad disminuye a una tasa controlada por

\[ \left(\frac{\sqrt{3}}{2}\right)^h. \]

Para obtener explícitamente la ACF, primero observamos que

\[ \rho(1) = \frac{\phi_1}{1-\phi_2} = \frac{1.5}{1.75} = \frac{6}{7}. \]

Usando \(\rho(0)=1\) y \(\rho(1)=6/7\), la solución puede escribirse como

\[ \rho(h) = \left(\frac{\sqrt{3}}{2}\right)^h \left[ \cos\left(\frac{\pi h}{6}\right) + \frac{\sqrt{3}}{7} \sin\left(\frac{\pi h}{6}\right) \right]. \tag{2.43}\]

Así aparecen simultáneamente las dos características observadas en una ACF cíclica:

  1. el término trigonométrico genera cambios periódicos de signo;
  2. el factor \((\sqrt{3}/2)^h\) reduce progresivamente su amplitud.

Por eso la ACF no presenta picos de igual altura indefinidamente, sino oscilaciones amortiguadas con un período aproximado de 12 rezagos.

set.seed(415)
modelos_ar2 <- tribble(
  ~Modelo, ~phi1, ~phi2,
  "Raíces reales", 0.6, 0.2,
  "Raíces complejas", 1.5, -0.75
)

trayectorias_ar2 <- pmap_dfr(
  modelos_ar2,
  function(Modelo, phi1, phi2) {
    tibble(
      x = 1:200,
      valor = as.numeric(stats::arima.sim(
        model = list(ar = c(phi1, phi2)),
        n = 200,
        sd = 1
      )),
      Modelo = Modelo,
      Tipo = "Trayectoria"
    )
  }
)

acf_ar2 <- pmap_dfr(
  modelos_ar2,
  function(Modelo, phi1, phi2) {
    acf_val <- stats::ARMAacf(
      ar = c(phi1, phi2),
      lag.max = 30
    )

    tibble(
      x = 0:30,
      valor = as.numeric(acf_val),
      Modelo = Modelo,
      Tipo = "ACF teórica"
    )
  }
)

bind_rows(trayectorias_ar2, acf_ar2) |>
  ggplot(aes(x = x, y = valor)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_line() +
  facet_grid(Tipo ~ Modelo, scales = "free") +
  labs(
    x = NULL,
    y = NULL,
    title = "Las raíces determinan la forma de la dependencia autorregresiva"
  )
Cuatro paneles. Las filas muestran trayectorias y autocorrelaciones; las columnas comparan un AR(2) con raíces reales y otro con raíces complejas que genera oscilaciones amortiguadas.
Figura 2.6: Trayectorias y ACF teóricas de dos procesos AR(2) estacionarios.

La Figura 2.6 anticipa un principio general: la ACF de un AR(\(p\)) no se corta después de \(p\) rezagos. En cambio, satisface una ecuación en diferencias con la misma estructura autorregresiva:

\[ \rho(h) - \phi_1\rho(h-1) - \cdots - \phi_p\rho(h-p) =0, \tag{2.44}\]

para los rezagos apropiados. La forma de la solución depende de las raíces del polinomio (Prado et al. 2021, sec. 2.1.4).

2.10 Autocorrelación parcial

La ACF mezcla asociaciones directas e indirectas. En un AR(1), por ejemplo, \(Y_t\) y \(Y_{t-2}\) están correlacionados aunque el modelo incluya únicamente \(Y_{t-1}\). Parte de esa relación ocurre a través del valor intermedio.

La autocorrelación parcial a rezago \(h\) intenta medir la asociación lineal entre \(Y_t\) y \(Y_{t-h}\) después de eliminar el efecto lineal de las observaciones intermedias. Una definición útil consiste en considerar las regresiones lineales de cada extremo sobre

\[ Y_{t-1},Y_{t-2},\ldots,Y_{t-h+1} \]

y calcular la correlación entre los dos residuos resultantes. Shumway y Stoffer formalizan esta construcción en su definición de PACF (Shumway y Stoffer 2025, sec. 3.3.2).

La propiedad clave para esta semana es:

\[ \phi(h,h)=0, \qquad h>p, \tag{2.45}\]

si el proceso es AR(\(p\)). Es decir, la PACF poblacional de un AR(\(p\)) se corta después del rezago \(p\) (Prado et al. 2021, sec. 2.1.5; Shumway y Stoffer 2025, Example 3.15).

ar2_coef <- c(1.5, -0.75)
lag_ar2 <- 24

acf_ar2_teorica <- tibble(
  h = 0:lag_ar2,
  valor = as.numeric(stats::ARMAacf(
    ar = ar2_coef,
    lag.max = lag_ar2
  )),
  Funcion = "ACF"
)

pacf_ar2_teorica <- tibble(
  h = 1:lag_ar2,
  valor = as.numeric(stats::ARMAacf(
    ar = ar2_coef,
    lag.max = lag_ar2,
    pacf = TRUE
  )),
  Funcion = "PACF"
)

bind_rows(acf_ar2_teorica, pacf_ar2_teorica) |>
  ggplot(aes(x = h, y = valor)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_segment(aes(xend = h, yend = 0)) +
  facet_wrap(~Funcion, ncol = 1) +
  labs(
    x = "Rezago h",
    y = NULL,
    title = "ACF que decae frente a PACF que se corta"
  )
Dos paneles. La ACF oscila y decae gradualmente; la PACF tiene valores no nulos en los dos primeros rezagos y es cero después del segundo.
Figura 2.7: ACF y PACF teóricas de un AR(2) con \(\phi_1=1.5\) y \(\phi_2=-0.75\).

La Figura 2.7 explica por qué ACF y PACF se utilizan conjuntamente en una identificación preliminar. Para un AR(\(p\)), esperamos una ACF que decae y una PACF que se corta después de \(p\). Más adelante veremos que el patrón complementario aparece en los modelos MA, y que los modelos ARMA pueden presentar colas en ambas funciones.

Advertencia“Corte” es una propiedad poblacional

En datos reales no esperamos que \(\widehat\phi(h,h)\) sea exactamente cero después de un rezago. La PACF muestral fluctúa. Por eso debemos buscar valores compatibles con ruido muestral después de cierto rezago, no ceros exactos.

2.11 Pronóstico de un AR(1)

Retomemos el enfoque de Sección 1.5. Supongamos que conocemos \(\mu\), \(\phi\) y \(\sigma_\varepsilon^2\), y que observamos \(Y_T\). De Ecuación 2.16,

\[ Y_{T+1}-\mu = \phi(Y_T-\mu)+\varepsilon_{T+1}. \]

Dos pasos adelante,

\[ \begin{aligned} Y_{T+2}-\mu &=\phi(Y_{T+1}-\mu)+\varepsilon_{T+2}\\ &=\phi^2(Y_T-\mu) +\phi\varepsilon_{T+1} +\varepsilon_{T+2}. \end{aligned} \]

Por iteración,

\[ Y_{T+h}-\mu = \phi^h(Y_T-\mu) + \sum_{j=0}^{h-1}\phi^j\varepsilon_{T+h-j}. \tag{2.46}\]

2.11.1 Media predictiva y reversión hacia la media

Condicionando en la información disponible al tiempo \(T\),

\[ E(Y_{T+h}\mid\mathcal I_T) = \mu+\phi^h(Y_T-\mu). \tag{2.47}\]

Como \(|\phi|<1\),

\[ \phi^h\longrightarrow0 \qquad\text{cuando}\qquad h\longrightarrow\infty, \]

y entonces

\[ E(Y_{T+h}\mid\mathcal I_T) \longrightarrow \mu. \tag{2.48}\]

Este comportamiento se denomina reversión hacia la media. Si \(\phi>0\), la convergencia es monotónica en el signo de la desviación inicial; si \(\phi<0\), el pronóstico alterna alrededor de \(\mu\) mientras su amplitud disminuye.

2.11.2 Varianza predictiva

A partir de Ecuación 2.46 y de la no-correlación de las innovaciones futuras,

\[ \begin{aligned} \operatorname{Var}(Y_{T+h}\mid\mathcal I_T) &= \sigma_\varepsilon^2 \sum_{j=0}^{h-1}\phi^{2j}\\ &= \sigma_\varepsilon^2 \frac{1-\phi^{2h}}{1-\phi^2}. \end{aligned} \tag{2.49}\]

Cuando \(h\to\infty\),

\[ \operatorname{Var}(Y_{T+h}\mid\mathcal I_T) \longrightarrow \frac{\sigma_\varepsilon^2}{1-\phi^2}, \]

que coincide con la varianza marginal de Ecuación 2.19. A horizontes largos, la información particular contenida en \(Y_T\) se desvanece y la distribución predictiva se aproxima a la distribución estacionaria.

Si además suponemos innovaciones gaussianas,

\[ Y_{T+h}\mid\mathcal I_T \sim N\left( \mu+\phi^h(Y_T-\mu), \sigma_\varepsilon^2\frac{1-\phi^{2h}}{1-\phi^2} \right). \tag{2.50}\]

Prado, Ferreira y West presentan el pronóstico de procesos AR a partir de su estructura dinámica y muestran cómo las raíces determinan el decaimiento o la oscilación de la función de pronóstico (Prado et al. 2021, sec. 2.2).

mu_f <- 10
phi_f <- 0.8
sigma_f <- 2
y_T <- 16
h_f <- 1:20

pronostico_ar1 <- tibble(
  h = h_f,
  media = mu_f + phi_f^h * (y_T - mu_f),
  varianza = sigma_f^2 * (1 - phi_f^(2 * h)) / (1 - phi_f^2)
) |>
  mutate(
    sd = sqrt(varianza),
    inferior = media + qnorm(0.025) * sd,
    superior = media + qnorm(0.975) * sd
  )

ggplot(pronostico_ar1, aes(x = h, y = media)) +
  geom_ribbon(
    aes(ymin = inferior, ymax = superior),
    alpha = 0.2
  ) +
  geom_line() +
  geom_hline(yintercept = mu_f, linetype = "dashed") +
  geom_point(
    data = tibble(h = 0, media = y_T),
    aes(x = h, y = media)
  ) +
  labs(
    x = "Horizonte h",
    y = "Y_(T+h)",
    title = "Reversión hacia la media y crecimiento de la incertidumbre",
    subtitle = "μ = 10, φ = 0.8, σ_ε = 2 y Y_T = 16"
  )
Pronóstico de veinte pasos de un AR(1). La media predictiva comienza por encima de la media estacionaria y converge hacia ella, mientras el intervalo predictivo se ensancha hasta estabilizarse.
Figura 2.8: Media e intervalo predictivo de un AR(1) con parámetros conocidos.

La Figura 2.8 conecta las dos ideas principales de la semana: la dependencia temporal determina tanto la trayectoria del pronóstico medio como la velocidad con que se pierde información sobre el estado actual.

ImportanteParámetros conocidos es una simplificación deliberada

En esta sección la única incertidumbre proviene de innovaciones futuras. En aplicaciones reales también desconocemos \(\mu\), \(\phi\) y \(\sigma_\varepsilon^2\). La semana 4 estudiará estimación frecuentista y la semana 5 incorporará incertidumbre sobre parámetros mediante inferencia bayesiana. La distribución predictiva posterior de Ecuación 1.4 integrará ambas fuentes de incertidumbre.

2.12 Aplicación: la serie de Recruitment

Shumway y Stoffer utilizan la serie mensual rec, distribuida con el paquete astsa, como ejemplo de identificación preliminar de un proceso autorregresivo. Su ACF presenta un patrón oscilatorio y su PACF concentra los valores importantes en los primeros dos rezagos, un comportamiento compatible con un AR(2) (Shumway y Stoffer 2025, Example 3.17).

Usaremos astsa únicamente como fuente del conjunto de datos; el análisis se realizará con objetos y gráficos construidos explícitamente en el capítulo.

if (!requireNamespace("astsa", quietly = TRUE)) {
  stop(
    "El ejemplo de Recruitment requiere el paquete 'astsa'. ",
    "Instálelo antes de compilar este capítulo."
  )
}

rec_env <- new.env()
data("rec", package = "astsa", envir = rec_env)
rec_obj <- rec_env$rec

rec_ts <- tibble(
  t = seq_along(rec_obj),
  Reclutamiento = as.numeric(rec_obj)
) |>
  as_tsibble(index = t)

stopifnot(
  nrow(rec_ts) > 100,
  !anyNA(rec_ts$Reclutamiento)
)
rec_ts |>
  autoplot(Reclutamiento) +
  labs(
    x = "Mes (índice)",
    y = "Recruitment",
    title = "Serie mensual de Recruitment"
  )
Gráfico temporal de la serie Recruitment con oscilaciones persistentes a lo largo de la muestra.
Figura 2.9: Serie mensual de Recruitment distribuida con astsa.

La Figura 2.9 muestra oscilaciones persistentes, pero la trayectoria por sí sola no identifica un orden autorregresivo. Examinemos la dependencia por rezagos.

lag_rec <- 48
T_rec <- nrow(rec_ts)

acf_rec_obj <- stats::acf(
  rec_ts$Reclutamiento,
  lag.max = lag_rec,
  plot = FALSE,
  demean = TRUE
)

pacf_rec_obj <- stats::pacf(
  rec_ts$Reclutamiento,
  lag.max = lag_rec,
  plot = FALSE
)

acf_rec <- tibble(
  h = 0:lag_rec,
  valor = as.numeric(acf_rec_obj$acf)
)

pacf_rec <- tibble(
  h = 1:lag_rec,
  valor = as.numeric(pacf_rec_obj$acf)
)

banda_rec <- 1.96 / sqrt(T_rec)
ggplot(acf_rec, aes(x = h, y = valor)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_hline(
    yintercept = c(-banda_rec, banda_rec),
    linetype = "dashed"
  ) +
  geom_segment(aes(xend = h, yend = 0)) +
  labs(
    x = "Rezago en meses",
    y = "ACF",
    title = "ACF de Recruitment"
  )
Función de autocorrelación muestral de Recruitment hasta 48 meses, con un patrón oscilatorio y bandas de referencia de ruido blanco.
Figura 2.10: ACF muestral de la serie Recruitment.
ggplot(pacf_rec, aes(x = h, y = valor)) +
  geom_hline(yintercept = 0, linewidth = 0.3) +
  geom_hline(
    yintercept = c(-banda_rec, banda_rec),
    linetype = "dashed"
  ) +
  geom_segment(aes(xend = h, yend = 0)) +
  labs(
    x = "Rezago en meses",
    y = "PACF",
    title = "PACF de Recruitment"
  )
Función de autocorrelación parcial muestral de Recruitment hasta 48 meses. Los primeros dos rezagos destacan con respecto a la mayoría de rezagos posteriores.
Figura 2.11: PACF muestral de la serie Recruitment.

La lectura conjunta de Figura 2.10 y Figura 2.11 sugiere una estructura autorregresiva de orden bajo: la ACF exhibe una cola oscilatoria, mientras la PACF concentra la señal principal en los primeros rezagos. Shumway y Stoffer interpretan este patrón como compatible con un AR(2) (Shumway y Stoffer 2025, Example 3.17).

No ajustaremos todavía el modelo ni compararemos AIC, BIC o pruebas residuales. Esa decisión es deliberada: identificación preliminar no es lo mismo que estimación, selección y diagnóstico. Estos pasos corresponden a la semana 4.

2.13 Actividad computacional guiada

2.13.1 Parte A. Estacionariedad y momentos

  1. Simule \(T=500\) observaciones de un AR(1) con \(\phi=0.5\) y \(\sigma_\varepsilon=2\).
  2. Compare la media y varianza empíricas con Ecuación 2.15 y Ecuación 2.19.
  3. Repita la simulación para \(\phi=0.95\).
  4. Explique por qué la segunda trayectoria puede parecer menos estable aunque ambos procesos satisfagan \(|\phi|<1\).

2.13.2 Parte B. ACF teórica y muestral

  1. Para \(\phi\in\{0.2,0.6,0.9,-0.6\}\), grafique \(\rho(h)=\phi^h\) hasta \(h=30\).
  2. Simule una serie para cada valor y calcule la ACF muestral.
  3. Identifique qué características se conservan entre teoría y muestra y cuáles fluctúan.
  4. Discuta por qué una muestra de tamaño \(T=50\) hace más difícil reconocer el patrón que una muestra de tamaño \(T=500\).

2.13.3 Parte C. Raíces de un AR(2)

Considere los modelos

\[ Y_t=0.6Y_{t-1}+0.2Y_{t-2}+\varepsilon_t \]

y

\[ Y_t=1.5Y_{t-1}-0.75Y_{t-2}+\varepsilon_t. \]

  1. Calcule las raíces de \(\Phi(z)\) usando polyroot().
  2. Verifique que sus módulos exceden uno.
  3. Simule ambos procesos.
  4. Compare sus ACF teóricas con stats::ARMAacf().
  5. Relacione el tipo de raíz con el comportamiento observado.

2.13.4 Parte D. Pronóstico con parámetros conocidos

Para un AR(1) con \(\mu=100\), \(\phi=0.7\), \(\sigma_\varepsilon=5\) y observación actual \(Y_T=130\):

  1. calcule la media predictiva para \(h=1,5,10,20\);
  2. calcule la desviación estándar predictiva en cada horizonte;
  3. construya intervalos predictivos gaussianos del 95 %;
  4. explique por qué la media se acerca a 100 y la varianza se acerca a la varianza marginal.

2.14 Puente hacia inferencia y modelos ARMA

Hasta ahora hemos tratado \(\phi\), \(\phi_1,\ldots,\phi_p\) y \(\sigma_\varepsilon^2\) como cantidades conocidas. Esto permitió aislar tres ideas fundamentales:

  1. la estacionariedad restringe los valores posibles de los parámetros;
  2. las raíces del polinomio AR controlan la forma de la dependencia y del pronóstico;
  3. la incertidumbre predictiva aumenta con el horizonte incluso cuando los parámetros son conocidos.

Estas ideas reaparecerán en dos direcciones distintas.

2.14.1 Hacia ARMA

En la semana 3 estudiaremos modelos MA y ARMA. Allí formalizaremos causalidad e invertibilidad y veremos por qué el patrón “ACF con cola, PACF con corte” es característico de un AR puro, mientras otros modelos producen patrones diferentes.

2.14.2 Hacia inferencia frecuentista y bayesiana

En la semana 4 estimaremos modelos AR/ARMA y estudiaremos verosimilitud, criterios de información y diagnóstico. En la semana 5, la condición de estacionariedad dejará de ser solo una propiedad matemática: también deberá incorporarse al soporte de distribuciones a priori o a la parametrización del modelo bayesiano. La distribución predictiva posterior de Ecuación 1.4 propagará la incertidumbre sobre los parámetros hacia observaciones futuras.

TipUna restricción del modelo se convierte en una restricción inferencial

Si un AR(1) se formula bajo \(|\phi|<1\), una inferencia bayesiana coherente debe reconocer que valores fuera de esa región no pertenecen al modelo estacionario que estamos postulando. Más adelante compararemos distintas maneras de imponer esta condición y estudiaremos su importancia cuando \(\phi\) está cerca de uno.

2.15 Síntesis

Las ideas centrales de la semana son las siguientes:

  • la estacionariedad expresa invariancia temporal del comportamiento probabilístico;
  • la estacionariedad débil requiere media constante y autocovarianza dependiente únicamente del rezago;
  • la ACF \(\rho(h)\) estandariza la autocovarianza y describe dependencia lineal por rezagos;
  • una ACF muestral es una estimación y no debe confundirse con la ACF poblacional;
  • el ruido blanco tiene ACF nula en rezagos distintos de cero, pero no necesita ser independiente salvo que se añadan supuestos;
  • un AR(1) estacionario tiene media \(c/(1-\phi)\), varianza \(\sigma_\varepsilon^2/(1-\phi^2)\) y ACF \(\phi^{|h|}\);
  • \(|\phi|\) controla persistencia y el signo de \(\phi\) controla alternancia;
  • cuando \(\phi\) se acerca a uno, la dependencia decae lentamente y el proceso puede parecer casi no estacionario;
  • en un AR(\(p\)), el polinomio autorregresivo y sus raíces determinan la estructura dinámica;
  • la PACF poblacional de un AR(\(p\)) se corta después del rezago \(p\);
  • el pronóstico de un AR(1) revierte hacia la media y su varianza predictiva crece con el horizonte hasta alcanzar la varianza estacionaria;
  • ACF y PACF son herramientas de identificación preliminar, no sustitutos de estimación, selección y diagnóstico.

En la siguiente semana introduciremos modelos MA y ARMA y desarrollaremos formalmente los conceptos de causalidad e invertibilidad. Eso permitirá entender por qué distintos modelos pueden producir estructuras de dependencia diferentes y cómo representarlos en términos de innovaciones.

2.16 Ejercicios

2.16.1 Conceptuales

  1. Estacionariedad y calendario. Un proceso mensual tiene la misma media y varianza en todos los meses, pero la correlación entre enero y febrero es distinta de la correlación entre julio y agosto, aun cuando ambos pares están separados por un mes. ¿Puede ser débilmente estacionario? Justifique.

  2. Estricta frente a débil. Explique por qué verificar media constante y una ACF estable no basta, en general, para demostrar estacionariedad estricta. ¿Qué cambia si el proceso es gaussiano?

  3. Ruido blanco. Construya conceptualmente un ejemplo de una serie que pueda ser incorrelacionada pero no independiente. Explique por qué llamarla ruido blanco no autoriza automáticamente el uso de una verosimilitud producto de densidades marginales.

  4. Persistencia. Compare dos AR(1) con \(\phi=0.4\) y \(\phi=0.95\), ambos con la misma varianza de innovaciones. ¿Cuál tiene mayor varianza marginal? ¿Cuál olvida más lentamente un choque?

  5. Signo de \(\phi\). Para \(\phi=-0.8\), determine los signos de \(\rho(1)\), \(\rho(2)\), \(\rho(3)\) y \(\rho(4)\). Describa el tipo de trayectoria que espera observar.

  6. ACF y PACF. Una serie presenta una ACF que decae gradualmente y una PACF con dos valores grandes seguidos de valores pequeños. Explique por qué un AR(2) sería un candidato preliminar, y por qué esa evidencia todavía no basta para aceptarlo como modelo final.

2.16.2 Derivaciones

  1. Media del AR(1). Partiendo de Ecuación 2.13, derive Ecuación 2.15. Explique qué ocurre con esta expresión cuando \(\phi=1\).

  2. Varianza del AR(1). Complete todos los pasos que llevan de Ecuación 2.16 a Ecuación 2.19. Indique exactamente dónde utiliza estacionariedad e incorrelación de la innovación con el pasado.

  3. Autocovarianza del AR(1). Demuestre ?eq-ar1-autocov para \(h\geq0\) y utilice simetría para extender el resultado a rezagos negativos.

  4. Vida media de un choque. Para un AR(1) con \(0<\phi<1\), defina la vida media \(h_{1/2}\) como el horizonte en que la magnitud de un choque esperado se reduce a la mitad. Resuelva

\[ \phi^{h_{1/2}}=\frac{1}{2} \]

y calcule \(h_{1/2}\) para \(\phi=0.5\), \(\phi=0.8\) y \(\phi=0.95\).

  1. Pronóstico. Derive Ecuación 2.46 por inducción y, a partir de ella, obtenga Ecuación 2.47 y Ecuación 2.49.

  2. Límite predictivo. Demuestre que, para \(|\phi|<1\), la media y la varianza predictivas convergen a la media y varianza marginales del proceso cuando \(h\to\infty\).

  3. AR(2). Para \(\phi_1=1.5\) y \(\phi_2=-0.75\):

    1. escriba \(\Phi(z)\);
    2. calcule sus raíces;
    3. verifique que están fuera del círculo unitario;
    4. explique por qué espera una ACF oscilatoria amortiguada.

2.16.3 Computacionales

  1. Variabilidad muestral de la ACF. Simule 500 realizaciones independientes de longitud \(T=50\) de un AR(1) con \(\phi=0.7\). Para cada realización estime \(\widehat\rho(1)\). Grafique la distribución de las 500 estimaciones y compárela con el valor teórico 0.7. Repita con \(T=500\).

  2. Persistencia y tamaño de muestra. Simule AR(1) con \(\phi\in\{0.5,0.9,0.99\}\) y tamaños \(T\in\{100,1000\}\). Compare trayectorias y ACF muestrales. ¿En qué casos sería más fácil confundir persistencia alta con no estacionariedad a partir de una inspección breve?

  3. AR(2) y raíces. Genere una cuadrícula de valores \((\phi_1,\phi_2)\), use polyroot() y marque cuáles satisfacen la condición de raíces. Compare numéricamente la región resultante con las desigualdades de Ecuación 2.29.

  4. Recruitment. Reproduzca Figura 2.10 y Figura 2.11.

    1. Cambie el máximo rezago a 24 y 72 meses.
    2. Explique qué aspectos de la interpretación permanecen estables.
    3. Calcule las raíces del AR(2) sugerido por la identificación preliminar únicamente después de ajustar el modelo con una función estándar de R; no use todavía criterios automáticos de selección.
    4. Señale qué análisis adicional sería necesario antes de concluir que el AR(2) es adecuado.
  5. Pronóstico AR(1). Escriba una función de R que reciba \(\mu\), \(\phi\), \(\sigma_\varepsilon\), \(Y_T\) y un horizonte máximo \(H\), y devuelva una tabla con media, varianza e intervalo predictivo gaussiano para \(h=1,\ldots,H\). Verifique su salida con Figura 2.8.

2.17 Lecturas recomendadas

Para esta semana:

  • Shumway y Stoffer: secciones 1.3–1.5 para medidas de dependencia, estacionariedad y estimación de correlación; secciones 3.1, 3.3 y 3.4 como apoyo para modelos AR, ACF/PACF y pronóstico (Shumway y Stoffer 2025).
  • Prado, Ferreira y West: secciones 1.2–1.3 para estacionariedad y autocorrelación; secciones 2.1–2.2 para estructura y pronóstico de autorregresiones (Prado et al. 2021).

La inferencia para parámetros AR se pospone deliberadamente: estimación clásica y selección se desarrollarán en la semana 4, mientras que la formulación bayesiana se estudiará en la semana 5.