2.2 Redes Neuronales

2.1 Introducción

Las redes neuronales artificiales (RNA) constituyen uno de los pilares fundamentales del desarrollo contemporáneo de la inteligencia artificial (IA) y del aprendizaje automático. Su origen conceptual se encuentra estrechamente vinculado al estudio del sistema nervioso biológico y a los intentos tempranos por modelar, de manera matemática y computacional, los mecanismos de aprendizaje humano. Desde los primeros trabajos inspirados en la neurociencia, las RNA han evolucionado de modelos simples a arquitecturas altamente complejas capaces de resolver problemas de elevada dimensionalidad y no linealidad [20, 37].

\begin{aligned}

&\textbf{1. Entrada neta de una neurona artificial} \\[4pt]
&z = \sum_{i=1}^{n} w_i x_i + b \\[4pt]
&\text{donde:} \\
&z = \text{entrada neta o suma ponderada},\\
&x_i = \text{entrada número } i,\\
&w_i = \text{peso asociado a la entrada } x_i,\\
&n = \text{número total de entradas},\\
&b = \text{sesgo de la neurona}. \\[10pt]

&\textbf{2. Salida de una neurona artificial} \\[4pt]
&y = f\left(\sum_{i=1}^{n} w_i x_i + b\right) \\[4pt]
&\text{donde:} \\
&y = \text{salida de la neurona},\\
&f(\cdot) = \text{función de activación},\\
&w_i = \text{peso de la conexión } i,\\
&x_i = \text{valor de la entrada } i,\\
&b = \text{sesgo},\\
&n = \text{número total de entradas}. \\[10pt]

&\textbf{3. Función de activación sigmoide} \\[4pt]
&f(z) = \frac{1}{1+e^{-z}} \\[4pt]
&\text{donde:} \\
&f(z) = \text{salida de la función sigmoide},\\
&z = \text{entrada neta de la neurona},\\
&e = \text{número de Euler, aproximadamente } 2.71828. \\[10pt]

&\textbf{4. Función de activación ReLU} \\[4pt]
&f(z) = \max(0,z) \\[4pt]
&\text{donde:} \\
&f(z) = \text{salida de la función de activación},\\
&z = \text{entrada neta de la neurona}. \\[10pt]

&\textbf{5. Representación matricial de una capa neuronal} \\[4pt]
&\mathbf{z} = \mathbf{W}\mathbf{x} + \mathbf{b} \\[4pt]
&\mathbf{y} = f(\mathbf{W}\mathbf{x} + \mathbf{b}) \\[4pt]
&\text{donde:} \\
&\mathbf{x} = \text{vector de entradas},\\
&\mathbf{W} = \text{matriz de pesos sinápticos},\\
&\mathbf{b} = \text{vector de sesgos},\\
&\mathbf{z} = \text{vector de entradas netas},\\
&f(\cdot) = \text{función de activación},\\
&\mathbf{y} = \text{vector de salidas de la capa}. \\[10pt]

&\textbf{6. Error cuadrático para una observación} \\[4pt]
&E = \frac{1}{2}(y-\hat{y})^2 \\[4pt]
&\text{donde:} \\
&E = \text{error o función de pérdida},\\
&y = \text{valor real o deseado},\\
&\hat{y} = \text{valor estimado por la red neuronal}. \\[10pt]

&\textbf{7. Error cuadrático medio} \\[4pt]
&MSE = \frac{1}{N}\sum_{j=1}^{N}(y_j-\hat{y}_j)^2 \\[4pt]
&\text{donde:} \\
&MSE = \text{error cuadrático medio},\\
&N = \text{número total de observaciones},\\
&y_j = \text{valor real de la observación } j,\\
&\hat{y}_j = \text{valor predicho para la observación } j,\\
&j = \text{índice de cada observación}. \\[10pt]

&\textbf{8. Regla de aprendizaje mediante descenso del gradiente} \\[4pt]
&w_i^{(t+1)} = w_i^{(t)} - \eta \frac{\partial E}{\partial w_i} \\[4pt]
&\text{donde:} \\
&w_i^{(t)} = \text{valor actual del peso } i \text{ en la iteración } t,\\
&w_i^{(t+1)} = \text{nuevo valor del peso},\\
&\eta = \text{tasa de aprendizaje},\\
&E = \text{función de error},\\
&\frac{\partial E}{\partial w_i} = \text{gradiente del error respecto al peso } w_i,\\
&t = \text{número de iteración o época de entrenamiento}.

\end{aligned}

Uno de los hitos históricos más relevantes en este campo fue la formulación del perceptrón por Rosenblatt en 1962, considerado el primer modelo computacional de una neurona artificial capaz de aprender a partir de datos. A partir de este punto, el desarrollo de nuevas arquitecturas, funciones de activación y algoritmos de entrenamiento permitió superar gradualmente las limitaciones iniciales, dando lugar a redes multicapa, redes no lineales y, posteriormente, a los modelos de aprendizaje profundo ampliamente utilizados en la actualidad [18].

\begin{aligned}

&\textbf{1. Modelo matemático del perceptrón de Rosenblatt} \\[4pt]
&z = \sum_{i=1}^{n} w_i x_i + b \\[4pt]
&y =
\begin{cases}
1, & \text{si } z \geq 0,\\
0, & \text{si } z < 0
\end{cases} \\[4pt]
&\text{donde:} \\
&z = \text{entrada neta del perceptrón},\\
&x_i = \text{entrada número } i,\\
&w_i = \text{peso asociado a la entrada } x_i,\\
&n = \text{número total de entradas},\\
&b = \text{sesgo del perceptrón},\\
&y = \text{salida del perceptrón}. \\[10pt]

&\textbf{2. Regla de aprendizaje del perceptrón} \\[4pt]
&w_i^{(t+1)} = w_i^{(t)} + \eta(d-y)x_i \\[4pt]
&b^{(t+1)} = b^{(t)} + \eta(d-y) \\[4pt]
&\text{donde:} \\
&w_i^{(t)} = \text{peso actual de la conexión } i,\\
&w_i^{(t+1)} = \text{nuevo peso de la conexión } i,\\
&b^{(t)} = \text{sesgo actual},\\
&b^{(t+1)} = \text{nuevo sesgo},\\
&\eta = \text{tasa de aprendizaje},\\
&d = \text{salida deseada o valor objetivo},\\
&y = \text{salida obtenida por el perceptrón},\\
&x_i = \text{entrada número } i,\\
&t = \text{iteración del proceso de aprendizaje}. \\[10pt]

&\textbf{3. Error de predicción del perceptrón} \\[4pt]
&e = d-y \\[4pt]
&\text{donde:} \\
&e = \text{error de predicción},\\
&d = \text{salida deseada},\\
&y = \text{salida calculada por el perceptrón}. \\[10pt]

&\textbf{4. Función de activación escalón} \\[4pt]
&f(z) =
\begin{cases}
1, & \text{si } z \geq 0,\\
0, & \text{si } z < 0
\end{cases} \\[4pt]
&\text{donde:} \\
&f(z) = \text{función de activación escalón},\\
&z = \text{entrada neta del perceptrón}. \\[10pt]

&\textbf{5. Modelo de una neurona en una red multicapa} \\[4pt]
&\mathbf{z}^{(l)}
=
\mathbf{W}^{(l)}
\mathbf{a}^{(l-1)}
+
\mathbf{b}^{(l)} \\[4pt]
&\mathbf{a}^{(l)}
=
f\left(\mathbf{z}^{(l)}\right) \\[4pt]
&\text{donde:} \\
&\mathbf{z}^{(l)} = \text{vector de entradas netas de la capa } l,\\
&\mathbf{W}^{(l)} = \text{matriz de pesos de la capa } l,\\
&\mathbf{a}^{(l-1)} = \text{salida de la capa anterior},\\
&\mathbf{b}^{(l)} = \text{vector de sesgos de la capa } l,\\
&\mathbf{a}^{(l)} = \text{salida de la capa } l,\\
&f(\cdot) = \text{función de activación},\\
&l = \text{índice de la capa neuronal}. \\[10pt]

&\textbf{6. Función de activación no lineal sigmoide} \\[4pt]
&f(z) = \frac{1}{1+e^{-z}} \\[4pt]
&\text{donde:} \\
&f(z) = \text{salida de la función sigmoide},\\
&z = \text{entrada neta de la neurona},\\
&e = \text{número de Euler, aproximadamente } 2.71828. \\[10pt]

&\textbf{7. Función de activación ReLU} \\[4pt]
&f(z) = \max(0,z) \\[4pt]
&\text{donde:} \\
&f(z) = \text{salida de la función ReLU},\\
&z = \text{entrada neta de la neurona}. \\[10pt]

&\textbf{8. Representación general de una red neuronal profunda} \\[4pt]
&\mathbf{a}^{(L)}
=
f^{(L)}
\left(
\mathbf{W}^{(L)}
\mathbf{a}^{(L-1)}
+
\mathbf{b}^{(L)}
\right) \\[4pt]
&\text{donde:} \\
&\mathbf{a}^{(L)} = \text{salida de la última capa de la red},\\
&\mathbf{W}^{(L)} = \text{matriz de pesos de la última capa},\\
&\mathbf{a}^{(L-1)} = \text{salida de la capa anterior},\\
&\mathbf{b}^{(L)} = \text{vector de sesgos de la última capa},\\
&f^{(L)} = \text{función de activación de la última capa},\\
&L = \text{número total de capas de la red}. \\[10pt]

&\textbf{9. Composición de múltiples capas} \\[4pt]
&\mathbf{a}^{(L)}
=
f^{(L)}
\left(
\mathbf{W}^{(L)}
f^{(L-1)}
\left(
\mathbf{W}^{(L-1)}
\mathbf{a}^{(L-2)}
+
\mathbf{b}^{(L-1)}
\right)
+
\mathbf{b}^{(L)}
\right) \\[4pt]
&\text{donde:} \\
&\mathbf{a}^{(l)} = \text{salida de la capa } l,\\
&\mathbf{W}^{(l)} = \text{matriz de pesos de la capa } l,\\
&\mathbf{b}^{(l)} = \text{vector de sesgos de la capa } l,\\
&f^{(l)} = \text{función de activación de la capa } l,\\
&L = \text{número total de capas}. \\[10pt]

&\textbf{10. Relación entre el perceptrón y las redes neuronales modernas} \\[4pt]
&\text{Perceptrón}
\;\longrightarrow\;
\text{Red multicapa}
\;\longrightarrow\;
\text{Red no lineal}
\;\longrightarrow\;
\text{Aprendizaje profundo} \\[4pt]

&\text{donde:} \\
&\text{Perceptrón} = \text{modelo básico de una neurona artificial},\\
&\text{Red multicapa} = \text{conjunto de capas de neuronas interconectadas},\\
&\text{Red no lineal} = \text{red que emplea funciones de activación no lineales},\\
&\text{Aprendizaje profundo} = \text{uso de múltiples capas para aprender representaciones complejas}.

\end{aligned}

La capacidad de las redes neuronales para aprender patrones complejos directamente a partir de los datos ha propiciado su aplicación en una amplia gama de dominios, tales como el reconocimiento de patrones, el procesamiento de imágenes y señales, la clasificación de sistemas dinámicos, la predicción de series temporales y el control inteligente de procesos industriales [22, 11]. En el ámbito energético y de ingeniería, estas herramientas han demostrado ser especialmente valiosas para la modelación de sistemas no lineales, la optimización de procesos y la toma de decisiones basada en datos.

\begin{aligned}

&\textbf{1. Aprendizaje de patrones a partir de los datos} \\[4pt]
&\hat{y} = f\left(\sum_{i=1}^{n}w_i x_i+b\right) \\[4pt]
&\text{donde:} \\
&\hat{y} = \text{salida o valor estimado por la red neuronal},\\
&f(\cdot) = \text{función de activación},\\
&w_i = \text{peso asociado a la entrada } x_i,\\
&x_i = \text{variable de entrada número } i,\\
&n = \text{número total de variables de entrada},\\
&b = \text{sesgo de la neurona}. \\[10pt]

&\textbf{2. Clasificación de patrones} \\[4pt]
&\hat{c} = \arg\max_{k} P(c_k|\mathbf{x}) \\[4pt]
&\text{donde:} \\
&\hat{c} = \text{clase predicha por la red neuronal},\\
&c_k = \text{clase número } k,\\
&P(c_k|\mathbf{x}) = \text{probabilidad de pertenecer a la clase } c_k,\\
&\mathbf{x} = \text{vector de características de entrada},\\
&k = \text{índice de la clase}. \\[10pt]

&\textbf{3. Función Softmax para clasificación multiclase} \\[4pt]
&P(c_k|\mathbf{x}) =
\frac{e^{z_k}}
{\displaystyle\sum_{j=1}^{K}e^{z_j}} \\[4pt]
&\text{donde:} \\
&P(c_k|\mathbf{x}) = \text{probabilidad de que la entrada pertenezca a la clase } k,\\
&z_k = \text{salida neta correspondiente a la clase } k,\\
&K = \text{número total de clases},\\
&j = \text{índice utilizado para recorrer las clases},\\
&e = \text{número de Euler}. \\[10pt]

&\textbf{4. Predicción de series temporales} \\[4pt]
&\hat{y}_{t+1}
=
f(y_t,y_{t-1},\ldots,y_{t-p},
x_t,x_{t-1},\ldots,x_{t-q}) \\[4pt]
&\text{donde:} \\
&\hat{y}_{t+1} = \text{valor predicho para el instante } t+1,\\
&y_t = \text{valor observado en el instante } t,\\
&y_{t-p} = \text{valor observado } p \text{ periodos atrás},\\
&x_t = \text{variable externa en el instante } t,\\
&x_{t-q} = \text{variable externa } q \text{ periodos atrás},\\
&p,q = \text{número de retardos utilizados},\\
&t = \text{instante de tiempo}. \\[10pt]

&\textbf{5. Modelación de sistemas no lineales} \\[4pt]
&\mathbf{y}(t)
=
f\left(
\mathbf{x}(t),\mathbf{u}(t),\boldsymbol{\theta}
\right) \\[4pt]
&\text{donde:} \\
&\mathbf{y}(t) = \text{vector de salidas del sistema},\\
&\mathbf{x}(t) = \text{vector de estados del sistema},\\
&\mathbf{u}(t) = \text{vector de entradas o variables de control},\\
&\boldsymbol{\theta} = \text{vector de parámetros del modelo},\\
&f(\cdot) = \text{función no lineal aproximada por la red neuronal},\\
&t = \text{tiempo}. \\[10pt]

&\textbf{6. Aproximación de una función no lineal mediante una RNA} \\[4pt]
&\hat{y} = 
f\left(
\mathbf{W}_2
\,g\left(
\mathbf{W}_1\mathbf{x}+\mathbf{b}_1
\right)
+\mathbf{b}_2
\right) \\[4pt]
&\text{donde:} \\
&\hat{y} = \text{salida estimada del modelo},\\
&\mathbf{x} = \text{vector de entradas},\\
&\mathbf{W}_1 = \text{matriz de pesos de la capa oculta},\\
&\mathbf{b}_1 = \text{sesgo de la capa oculta},\\
&\mathbf{W}_2 = \text{matriz de pesos de la capa de salida},\\
&\mathbf{b}_2 = \text{sesgo de la capa de salida},\\
&g(\cdot) = \text{función de activación de la capa oculta},\\
&f(\cdot) = \text{función de activación de salida}. \\[10pt]

&\textbf{7. Error de modelación} \\[4pt]
&e_i = y_i-\hat{y}_i \\[4pt]
&\text{donde:} \\
&e_i = \text{error de predicción de la muestra } i,\\
&y_i = \text{valor real de la muestra } i,\\
&\hat{y}_i = \text{valor estimado por la red neuronal},\\
&i = \text{índice de la muestra}. \\[10pt]

&\textbf{8. Error cuadrático medio para evaluar el modelo} \\[4pt]
&MSE =
\frac{1}{N}
\sum_{i=1}^{N}
(y_i-\hat{y}_i)^2 \\[4pt]
&\text{donde:} \\
&MSE = \text{error cuadrático medio},\\
&N = \text{número total de muestras},\\
&y_i = \text{valor real de la muestra } i,\\
&\hat{y}_i = \text{valor predicho por la red},\\
&i = \text{índice de cada muestra}. \\[10pt]

&\textbf{9. Optimización de procesos} \\[4pt]
&\mathbf{x}^{*}
=
\arg\min_{\mathbf{x}}
J(\mathbf{x}) \\[4pt]
&\text{donde:} \\
&\mathbf{x}^{*} = \text{conjunto óptimo de variables del proceso},\\
&J(\mathbf{x}) = \text{función objetivo o función de costo},\\
&\mathbf{x} = \text{vector de variables de decisión},\\
&\arg\min = \text{operador que determina el valor que minimiza la función objetivo}. \\[10pt]

&\textbf{10. Optimización considerando restricciones} \\[4pt]
&\min_{\mathbf{x}} J(\mathbf{x}) \\[4pt]
&\text{sujeto a:} \\[4pt]
&g_j(\mathbf{x}) \leq 0,
\qquad j=1,2,\ldots,m \\[4pt]
&h_k(\mathbf{x}) = 0,
\qquad k=1,2,\ldots,r \\[4pt]
&\text{donde:} \\
&J(\mathbf{x}) = \text{función objetivo},\\
&g_j(\mathbf{x}) = \text{restricción de desigualdad } j,\\
&h_k(\mathbf{x}) = \text{restricción de igualdad } k,\\
&m = \text{número de restricciones de desigualdad},\\
&r = \text{número de restricciones de igualdad},\\
&\mathbf{x} = \text{variables de decisión}. \\[10pt]

&\textbf{11. Control inteligente basado en redes neuronales} \\[4pt]
&u(t)=f\left(e(t),\dot{e}(t),\int e(t)\,dt\right) \\[4pt]
&\text{donde:} \\
&u(t) = \text{señal de control aplicada al proceso},\\
&e(t) = \text{error entre la referencia y la salida del proceso},\\
&\dot{e}(t) = \text{derivada temporal del error},\\
&\displaystyle\int e(t)\,dt = \text{error acumulado en el tiempo},\\
&f(\cdot) = \text{función aprendida por la red neuronal},\\
&t = \text{tiempo}. \\[10pt]

&\textbf{12. Toma de decisiones basada en datos} \\[4pt]
&a^{*}
=
\arg\max_{a\in A}
P(a|\mathbf{x}) \\[4pt]
&\text{donde:} \\
&a^{*} = \text{acción o decisión óptima},\\
&A = \text{conjunto de acciones posibles},\\
&P(a|\mathbf{x}) = \text{probabilidad asociada a la acción } a \text{ dadas las variables } \mathbf{x},\\
&\mathbf{x} = \text{vector de datos disponibles},\\
&\arg\max = \text{operador que determina la acción con mayor probabilidad}. \\[10pt]

&\textbf{13. Aplicación en sistemas energéticos} \\[4pt]
&\hat{P}(t)
=
f\left(
T(t),P(t),Q(t),V(t),I(t),\mathbf{x}(t)
\right) \\[4pt]
&\text{donde:} \\
&\hat{P}(t) = \text{potencia estimada o predicha},\\
&T(t) = \text{temperatura del sistema},\\
&P(t) = \text{potencia activa},\\
&Q(t) = \text{potencia reactiva},\\
&V(t) = \text{tensión eléctrica},\\
&I(t) = \text{corriente eléctrica},\\
&\mathbf{x}(t) = \text{otras variables relevantes del sistema},\\
&f(\cdot) = \text{modelo no lineal aprendido por la red neuronal},\\
&t = \text{tiempo}. \\[10pt]

&\textbf{14. Relación general entre datos, modelo y decisión} \\[4pt]
&\mathbf{x}
\longrightarrow
\text{RNA}
\longrightarrow
\hat{\mathbf{y}}
\longrightarrow
J(\mathbf{x})
\longrightarrow
\text{decisión óptima} \\[4pt]
&\text{donde:} \\
&\mathbf{x} = \text{datos de entrada},\\
&\text{RNA} = \text{red neuronal artificial},\\
&\hat{\mathbf{y}} = \text{salida estimada por la red},\\
&J(\mathbf{x}) = \text{función de evaluación u objetivo},\\
&\text{decisión óptima} = \text{acción seleccionada con base en los resultados del modelo}.

\end{aligned}

En este contexto, el presente documento aborda los fundamentos teóricos y prácticos de diversos tipos de redes neuronales clásicas, incluyendo el perceptrón, la red Adaline, los modelos entrenados mediante retropropagación y las redes de funciones de base radial (RBF). Asimismo, se analizan sus principios de funcionamiento, ventajas, limitaciones y su implementación mediante software de programación especializado, proporcionando una visión integral de su relevancia dentro del ecosistema actual de la inteligencia artificial.

\begin{aligned}

&\textbf{1. Modelo matemático del perceptrón} \\[4pt]
&z = \sum_{i=1}^{n}w_i x_i+b \\[4pt]
&y =
\begin{cases}
1, & \text{si } z\geq0,\\
0, & \text{si } z<0
\end{cases} \\[4pt]
&\text{donde:} \\
&z = \text{entrada neta del perceptrón},\\
&w_i = \text{peso asociado a la entrada } x_i,\\
&x_i = \text{entrada número } i,\\
&n = \text{número total de entradas},\\
&b = \text{sesgo},\\
&y = \text{salida del perceptrón}. \\[10pt]

&\textbf{2. Regla de aprendizaje del perceptrón} \\[4pt]
&w_i^{(t+1)}
=
w_i^{(t)}
+
\eta(d-y)x_i \\[4pt]
&b^{(t+1)}
=
b^{(t)}
+
\eta(d-y) \\[4pt]
&\text{donde:} \\
&\eta = \text{tasa de aprendizaje},\\
&d = \text{salida deseada},\\
&y = \text{salida calculada},\\
&t = \text{iteración de entrenamiento}. \\[10pt]

&\textbf{3. Modelo matemático de la red Adaline} \\[4pt]
&\hat{y}
=
\sum_{i=1}^{n}w_i x_i+b \\[4pt]
&\text{donde:} \\
&\hat{y} = \text{salida lineal estimada por Adaline},\\
&w_i = \text{peso de la entrada } i,\\
&x_i = \text{entrada } i,\\
&b = \text{sesgo},\\
&n = \text{número de entradas}. \\[10pt]

&\textbf{4. Función de error de Adaline} \\[4pt]
&E
=
\frac{1}{2}
(d-\hat{y})^2 \\[4pt]
&\text{donde:} \\
&E = \text{función de error},\\
&d = \text{salida deseada},\\
&\hat{y} = \text{salida estimada por Adaline}. \\[10pt]

&\textbf{5. Error cuadrático medio de Adaline} \\[4pt]
&MSE
=
\frac{1}{N}
\sum_{j=1}^{N}
(d_j-\hat{y}_j)^2 \\[4pt]
&\text{donde:} \\
&MSE = \text{error cuadrático medio},\\
&N = \text{número total de muestras},\\
&d_j = \text{salida deseada de la muestra } j,\\
&\hat{y}_j = \text{salida estimada de la muestra } j. \\[10pt]

&\textbf{6. Actualización de pesos mediante descenso del gradiente} \\[4pt]
&w_i^{(t+1)}
=
w_i^{(t)}
-
\eta
\frac{\partial E}{\partial w_i} \\[4pt]
&\text{donde:} \\
&w_i^{(t)} = \text{peso actual},\\
&w_i^{(t+1)} = \text{nuevo peso},\\
&\eta = \text{tasa de aprendizaje},\\
&\frac{\partial E}{\partial w_i}
=
\text{gradiente del error respecto al peso } w_i. \\[10pt]

&\textbf{7. Retropropagación del error} \\[4pt]
&\delta_j^{(l)}
=
f'\left(z_j^{(l)}\right)
\sum_{k}
w_{kj}^{(l+1)}
\delta_k^{(l+1)} \\[4pt]
&\text{donde:} \\
&\delta_j^{(l)} = \text{error asociado a la neurona } j \text{ de la capa } l,\\
&f'(\cdot) = \text{derivada de la función de activación},\\
&z_j^{(l)} = \text{entrada neta de la neurona } j,\\
&w_{kj}^{(l+1)} = \text{peso entre las neuronas de las capas } l \text{ y } l+1,\\
&\delta_k^{(l+1)} = \text{error de la neurona } k \text{ de la capa siguiente}. \\[10pt]

&\textbf{8. Actualización de pesos mediante retropropagación} \\[4pt]
&w_{ij}^{(l+1)}
=
w_{ij}^{(l+1)}
-
\eta
\delta_j^{(l+1)}
a_i^{(l)} \\[4pt]
&\text{donde:} \\
&w_{ij}^{(l+1)} = \text{peso entre las neuronas } i \text{ y } j,\\
&\eta = \text{tasa de aprendizaje},\\
&\delta_j^{(l+1)} = \text{error de la neurona } j,\\
&a_i^{(l)} = \text{salida de la neurona } i \text{ de la capa anterior}. \\[10pt]

&\textbf{9. Función de activación sigmoide utilizada en retropropagación} \\[4pt]
&f(z)
=
\frac{1}{1+e^{-z}} \\[4pt]
&f'(z)
=
f(z)\left[1-f(z)\right] \\[4pt]
&\text{donde:} \\
&f(z) = \text{función sigmoide},\\
&f'(z) = \text{derivada de la función sigmoide},\\
&z = \text{entrada neta de la neurona},\\
&e = \text{número de Euler}. \\[10pt]

&\textbf{10. Modelo de una red de funciones de base radial (RBF)} \\[4pt]
&\hat{y}
=
\sum_{j=1}^{m}
w_j
\phi_j(\mathbf{x})
+
b \\[4pt]
&\text{donde:} \\
&\hat{y} = \text{salida de la red RBF},\\
&m = \text{número de funciones de base radial},\\
&w_j = \text{peso asociado a la función radial } j,\\
&\phi_j(\mathbf{x}) = \text{función de base radial } j,\\
&\mathbf{x} = \text{vector de entrada},\\
&b = \text{sesgo}. \\[10pt]

&\textbf{11. Función de base radial gaussiana} \\[4pt]
&\phi_j(\mathbf{x})
=
\exp
\left(
-\frac{
\|\mathbf{x}-\mathbf{c}_j\|^2
}{
2\sigma_j^2
}
\right) \\[4pt]
&\text{donde:} \\
&\phi_j(\mathbf{x}) = \text{salida de la función radial } j,\\
&\mathbf{x} = \text{vector de entrada},\\
&\mathbf{c}_j = \text{centro de la función radial } j,\\
&\|\mathbf{x}-\mathbf{c}_j\| = \text{distancia entre la entrada y el centro},\\
&\sigma_j = \text{ancho o dispersión de la función radial},\\
&j = \text{índice de la función radial}. \\[10pt]

&\textbf{12. Distancia euclidiana utilizada en una RBF} \\[4pt]
&\|\mathbf{x}-\mathbf{c}_j\|
=
\sqrt{
\sum_{i=1}^{n}
(x_i-c_{ij})^2
} \\[4pt]
&\text{donde:} \\
&x_i = \text{componente } i \text{ del vector de entrada},\\
&c_{ij} = \text{componente } i \text{ del centro } j,\\
&n = \text{número de variables de entrada}. \\[10pt]

&\textbf{13. Función de pérdida general para una red neuronal} \\[4pt]
&J(\mathbf{W},\mathbf{b})
=
\frac{1}{N}
\sum_{j=1}^{N}
\left(
y_j-\hat{y}_j
\right)^2 \\[4pt]
&\text{donde:} \\
&J(\mathbf{W},\mathbf{b}) = \text{función de costo de la red},\\
&\mathbf{W} = \text{conjunto de pesos de la red},\\
&\mathbf{b} = \text{conjunto de sesgos},\\
&N = \text{número de muestras},\\
&y_j = \text{valor real de la muestra } j,\\
&\hat{y}_j = \text{valor predicho por la red}. \\[10pt]

&\textbf{14. Proceso general de entrenamiento de una RNA} \\[4pt]
&\mathbf{x}
\longrightarrow
\text{Propagación hacia adelante}
\longrightarrow
\hat{\mathbf{y}}
\longrightarrow
E
\longrightarrow
\text{Retropropagación}
\longrightarrow
\Delta\mathbf{W}
\longrightarrow
\mathbf{W}_{\text{actualizados}} \\[4pt]
&\text{donde:} \\
&\mathbf{x} = \text{datos de entrada},\\
&\hat{\mathbf{y}} = \text{salida predicha},\\
&E = \text{error de predicción},\\
&\Delta\mathbf{W} = \text{cambio aplicado a los pesos},\\
&\mathbf{W}_{\text{actualizados}} = \text{nuevos pesos de la red}. \\[10pt]

&\textbf{15. Comparación conceptual de los modelos} \\[4pt]
&\text{Perceptrón}
\rightarrow
\text{Clasificación lineal} \\[4pt]
&\text{Adaline}
\rightarrow
\text{Aprendizaje mediante minimización del error} \\[4pt]
&\text{Retropropagación}
\rightarrow
\text{Entrenamiento de redes multicapa} \\[4pt]
&\text{RBF}
\rightarrow
\text{Modelación mediante funciones de base radial} \\[4pt]
&\text{donde:} \\
&\text{Perceptrón} = \text{modelo de clasificación basado en una función de decisión},\\
&\text{Adaline} = \text{neurona lineal adaptativa basada en el error cuadrático},\\
&\text{Retropropagación} = \text{algoritmo para ajustar los pesos de redes multicapa},\\
&\text{RBF} = \text{red neuronal basada en funciones de base radial}.

\end{aligned}

2.2 Red Perceptrón

La red perceptrón representa la forma más elemental de una red neuronal artificial y constituye el punto de partida conceptual para el estudio de arquitecturas neuronales más avanzadas. Está compuesta por una sola capa de neuronas artificiales que realizan una combinación lineal de las entradas, seguida de la aplicación de una función de activación, típicamente una función escalón, que produce una salida binaria [20, 37].

Desde un punto de vista matemático, el perceptrón implementa un clasificador lineal capaz de separar conjuntos de datos mediante un hiperplano en el espacio de características. Su simplicidad estructural facilita la comprensión de los principios básicos del aprendizaje supervisado, tales como la actualización de pesos, el ajuste de umbrales y la convergencia del algoritmo de entrenamiento, lo que explica su uso extendido con fines educativos y formativos [34, 8].

No obstante, el perceptrón presenta limitaciones inherentes a su naturaleza lineal. En particular, sólo puede resolver problemas que son linealmente separables, lo que restringe severamente su aplicabilidad en escenarios reales donde las relaciones entre variables suelen ser no lineales. Un ejemplo clásico de esta limitación es la incapacidad del perceptrón para resolver el problema XOR, lo cual motivó el desarrollo de redes multicapa y algoritmos de entrenamiento más sofisticados [36].

A pesar de estas restricciones, el perceptrón mantiene una relevancia histórica y conceptual significativa, ya que sentó las bases para la formulación de modelos neuronales más complejos y para la comprensión del aprendizaje automático desde una perspectiva algorítmica.


2.3 Red Adaline

La red Adaline (Adaptive Linear Neuron) surge como una extensión y mejora del modelo de perceptrón, introduciendo un enfoque más robusto para el ajuste de los pesos sinápticos. A diferencia del perceptrón clásico, Adaline emplea una función de activación lineal durante el proceso de entrenamiento y utiliza el criterio de minimización del error cuadrático medio (MSE) como función objetivo [20, 37].

Esta característica permite que el proceso de aprendizaje sea continuo y diferenciable, lo que facilita la aplicación de técnicas de optimización basadas en gradientes. Como resultado, la red Adaline presenta un comportamiento más estable durante el entrenamiento y una mayor capacidad para abordar problemas de regresión, además de tareas de clasificación lineal.

Desde una perspectiva práctica, Adaline constituye un modelo intermedio entre las redes neuronales más simples y las arquitecturas multicapa, proporcionando una base sólida para comprender los métodos de aprendizaje supervisado y los fundamentos del descenso del gradiente en redes neuronales artificiales.


2.3.1 Red Adaline Método 1

El Método 1 de entrenamiento de la red Adaline se basa en la aplicación directa del algoritmo delta, el cual ajusta iterativamente los pesos de la red en función del error cometido por la neurona. Este error se define como la diferencia entre la salida real de la red y el valor objetivo esperado, permitiendo una actualización gradual de los parámetros hasta alcanzar una solución óptima o cercana al mínimo global del error [20, 19, 22].

Una de las principales ventajas de este enfoque es su simplicidad computacional y su capacidad para converger de manera eficiente en problemas bien condicionados. Sin embargo, el rendimiento del algoritmo delta puede verse afectado por la escala de los datos de entrada, lo que hace recomendable la normalización o estandarización previa de las variables para mejorar la estabilidad y la velocidad de convergencia [—].


2.3.2 Red Adaline Método 2

El Método 2 introduce estrategias de optimización más avanzadas para el entrenamiento de la red Adaline, incorporando técnicas inductivas y heurísticas como los algoritmos genéticos. Estos métodos permiten explorar el espacio de soluciones de manera más amplia, reduciendo la probabilidad de quedar atrapados en mínimos locales durante el proceso de aprendizaje [14, 31].

Este enfoque resulta particularmente útil en problemas complejos o con superficies de error altamente no convexas, donde los métodos clásicos basados únicamente en gradientes pueden presentar limitaciones. No obstante, el uso de técnicas evolutivas implica un mayor costo computacional y requiere un ajuste cuidadoso de hiperparámetros, tales como la tasa de aprendizaje, el tamaño de la población y los criterios de selección, de forma similar a lo observado en otras arquitecturas neuronales [8, 2].


2.4 Red Retropropagación (Backpropagation)

La retropropagación del error constituye uno de los algoritmos más influyentes en el entrenamiento de redes neuronales multicapa o perceptrones multicapa (MLP). Este método permite calcular de manera eficiente el gradiente del error total de la red respecto a cada uno de sus pesos, utilizando la regla de la cadena para propagar el error desde la capa de salida hacia las capas ocultas [11, 25].

Gracias a la retropropagación, las redes neuronales pueden aprender representaciones no lineales altamente complejas, lo que ha impulsado avances significativos en áreas como el reconocimiento de imágenes, el procesamiento del lenguaje natural y la modelación de sistemas energéticos y de control. Sin embargo, este algoritmo no está exento de desafíos, entre los que destacan el sobreajuste (overfitting), la desaparición del gradiente y la sensibilidad a la inicialización de los pesos.

Para mitigar estos problemas, se han desarrollado diversas técnicas complementarias, tales como la regularización, la parada temprana (early stopping) y el uso de funciones de activación mejoradas, las cuales contribuyen a mejorar la generalización y la estabilidad del modelo [11, 5].


2.5 Funciones de Base Radial (RBF)

Las redes neuronales de funciones de base radial (RBF) constituyen una alternativa eficaz a las redes multicapa tradicionales, caracterizándose por el uso de funciones de activación radiales, generalmente gaussianas, en la capa oculta. Estas funciones responden a la distancia entre el vector de entrada y un conjunto de centros previamente definidos, lo que confiere a las RBF una elevada capacidad de interpolación y aproximación de funciones no lineales [11].

Una de las principales ventajas de las redes RBF es su rapidez de entrenamiento y su habilidad para generalizar más allá de los datos de entrenamiento, lo que las hace especialmente atractivas en aplicaciones donde la precisión y la eficiencia computacional son factores críticos, como la predicción de sistemas dinámicos y el análisis de señales [1].

No obstante, el desempeño de estas redes depende en gran medida de la selección adecuada de parámetros, como la ubicación de los centros y la anchura de las funciones de base. Este proceso suele requerir estrategias de optimización y validación exhaustivas para garantizar resultados robustos y confiables [4, 15].


2.6 Analizar y aplicar Redes Neuronales usando un Software de programación

El desarrollo y la aplicación de redes neuronales artificiales se han visto ampliamente favorecidos por la disponibilidad de plataformas de programación especializadas. Frameworks como TensorFlow y PyTorch proporcionan entornos flexibles y escalables para la implementación de modelos neuronales, facilitando el diseño de arquitecturas complejas, el entrenamiento eficiente y la evaluación rigurosa del desempeño de los modelos [32, 24].

Estas herramientas permiten a investigadores e ingenieros experimentar con distintos algoritmos de aprendizaje, funciones de activación y esquemas de optimización, adaptando los modelos a problemas específicos de ingeniería, energía y ciencias aplicadas [25, 23]. Además, la integración de técnicas como el aprendizaje transferido y el uso de redes preentrenadas ha impulsado avances notables en tareas de alta complejidad, reduciendo el tiempo de entrenamiento y mejorando la precisión de los modelos [17].

En conclusión, las redes neuronales artificiales, desde los modelos clásicos como el perceptrón y Adaline hasta las arquitecturas avanzadas de aprendizaje profundo, han demostrado ser herramientas fundamentales en la inteligencia artificial moderna. Su evolución continua y su creciente accesibilidad a través de software de programación consolidan su papel como tecnologías clave para la solución de problemas complejos en múltiples disciplinas, particularmente en el ámbito de la ingeniería y la energía.

[1] Hrycej, T. (1997). Neurocontrol: Towards an industrial control methodology. Wiley-Interscience.

[2] Akbar, S., & Pourazad, H. (2023). Modeling a petrochemical unit with artificial neural networks (ANN). In Artificial neural networks – Recent advances, new perspectives and applications. IntechOpen. https://doi.org/10.5772/intechopen.107723 (Autores corregidos: Shafaati Akbar y Pourazad Hamidreza; capítulo open access).

[3] Barriot, J.-P., & Sichoix, L. (2020). Inversion procedures: Gravity modeling, theory and computation, and other gravity papers. In H. K. Gupta (Ed.), Encyclopedia of solid earth geophysics (pp. 662–668). Springer Nature. https://doi.org/10.1007/978-3-030-58631-7_218-1 (o entrada equivalente; no es libro independiente, sino capítulo/entrada enciclopédica).

[4] Batra, A., Saini, L.M., Kumar, A., Noise cancellation using adaptive filter for bioimpedance signal, Int. J. Eng. Sci. Technol., 2011.

[5] Bortolussi, L., et al., Conformal predictions for hybrid system state classification, IEEE, 2019.

[6] Buessler, J., Urban, M., Modular neural architectures for robotics, Robotics and Autonomous Systems, 2003.
DOI: https://doi.org/10.1016/S0921-8890(02)00311-7

[7] Choi, Y., Yao, Y., Web page classification, Data & Knowledge Engineering, 2005.
https://doi.org/10.1145/1363686.13642

[8]da Fonseca, J. B. (2015). A novel algorithm to train multilayer hardlimit neural networks based on a mixed integer linear program model. En I. Rojas, G. Joya, & A. Catala (Eds.), Advances in computational intelligence (pp. 472–480). Springer. Lecture Notes in Computer Science, vol. 9095. https://doi.org/10.1007/978-3-319-19222-2_40

[9] Garrido L. Statistical mechanics of neural networks proceedings of the XIth Sitges conference, Sitges, Barcelona, Spain, 3-7 June 1990 /. In: Springer-Verlag; 1990. https://wcmq.idm.oclc.org/login?url=https://link.springer.com/book/10.1007/3-540-53267-6

[10] Giovannucci, E., Cigarette smoking and colorectal cancer, J. Natl. Cancer Inst., 2004.
DOI: 10.1002/ijc.24191

[11] Hastie, T., Tibshirani, R., Friedman, J., The elements of statistical learning, Springer, 2001.
DOI: https://doi.org/10.1007/978-0-387-21606-5

[12] Hirose, A., Nakano, Y., Applications of complex-valued self-organizing maps to ground penetrating radar imaging systems, IEEE Trans. Geosci. Remote Sens., 2011.
DOI: 10.5772/14019

https://www.intechopen.com/chapters/13305

[13] Kim, Y., Learning and coordination, MIT Press, 1994.

[14] Koza, J.R., Keane, M.A., Genetic breeding of non-linear optimal control strategies for broom balancing, Proc. IEEE, 1990.
DOI: https://doi.org/10.1109/5.103166

[15] Kůrková, V., Sanguineti, M., Tight bounds on rates of neural-network approximation, IEEE Trans. Neural Netw., 2001.
DOI: https://doi.org/10.1109/72.946585

[16] Lefty, R., Teacher education and teachers’ colleges, Routledge, 2019.

[17] Lo, Y., et al., Artificial intelligence-based drug design and discovery, Trends Pharmacol. Sci., 2020.
DOI: https://doi.org/10.1016/j.tips.2020.01.007

[18] Macukow, B., Neural networks – state of art, brief history, basic models and architecture, Studies in Logic, Grammar and Rhetoric, 2016.

[19] Manuel, P., et al., Multi-robot systems control implementation, Int. J. Adv. Robot. Syst., 2010.
DOI: https://doi.org/10.5772/9411

[20] Muñoz, J., Learning in feed-forward artificial neural networks I, 2009.

[21] Paegelow, M., Olmedo, M.T., Advances in geomatic simulations for environmental dynamics, Environ. Model. Softw., 2008.
DOI: https://doi.org/10.1016/j.envsoft.2007.01.011

[22] Pham, D.T., Liu, X., Neural networks for identification, prediction and control, Springer, 1995.
DOI: https://doi.org/10.1007/978-1-4612-2544-9

[23] Pooyandeh, M., et al., A comparison between complexity and temporal GIS models for spatio-temporal urban applications, Comput. Environ. Urban Syst.

[24] Prokopowicz, P., Mikołajewski, D., OFN-based brain function modeling, Neural Netw., 2017.
DOI: https://doi.org/10.1016/j.neunet.2017.03.002

[25] Raff, E., et al., Feed forward neural networks, Wiley Interdiscip. Rev. Data Min. Knowl. Discov., 2012.
DOI: https://doi.org/10.1002/widm.1078

[26] Rodríguez, A., et al., Time-frequency transforms for classification of power quality disturbances, IEEE Trans. Power Deliv., 2011.
DOI: https://doi.org/10.1109/TPWRD.2011.2139870

[27] Santos-García, G., Hernandez, C., Using artificial neural networks to identify glaucoma stages, Expert Syst. Appl., 2011.
DOI: https://doi.org/10.1016/j.eswa.2011.02.113

[28] Shahmaleki, P., et al., Vision-based hierarchical fuzzy controller and real time results for a wheeled autonomous robot, Robotics and Autonomous Systems, 2010.
DOI: https://doi.org/10.1016/j.robot.2010.04.005

[29] Skiadas, C.H., Advances in data analysis, Springer, 2010.
DOI: https://doi.org/10.1007/978-3-642-14420-9

[30] Soni, N., et al., In depth analysis, applications and future issues of artificial neural network, Int. J. Comput. Sci. Eng., 2020.

[31] Sullivan, K., Classification and prediction, Springer, 2011.
DOI: https://doi.org/10.1007/978-1-4419-9863-7

[32] Tan, Y., et al., Advances in swarm and computational intelligence, Springer, 2015.
DOI: https://doi.org/10.1007/978-3-319-09171-5

[33] Torres, J., Perceptron learning, Elsevier, 2020.

[34] Türker, M., Pre-informing methods for ANNs, Neural Processing Letters, 2023.
DOI: https://doi.org/10.1007/s11063-023-11123-4

[35] Wagner, F.H., Influences on upland system structure IV: The ungulate guild, J. Ecol., 2006.
DOI: https://doi.org/10.1111/j.1365-2745.2006.01134.x

[36] Zeng, B., et al., Faults detection for power systems, Electr. Power Syst. Res., 2010. DOI: 10.5772/9080

https://www.intechopen.com/chapters/10371