Definición
Un método iterativo de optimización que actualiza variables moviéndose en la dirección opuesta al gradiente de una función objetivo para reducir su valor, normalmente controlando el tamaño del paso (tasa de aprendizaje).

Principio

Principio
La idea organizadora es que el gradiente negativo es la dirección de mayor decrecimiento local de una función diferenciable, por lo que sucesivas pequeñas movidas a lo largo de −∇f disminuyen la función hasta alcanzar un punto estacionario bajo condiciones adecuadas.

Demostración

Demostración
Minimizar una cuadrática convexa f(x)=1/2 x^T A x − b^T x con A simétrica definida positiva iterando x_{k+1} = x_k − α ∇f(x_k) = x_k − α(Ax_k − b); con α en (0,2/λ_max(A)) el método converge linealmente al minimizador.

Aplicación incorrecta

Aplicación incorrecta
Usar un tamaño de paso fijo demasiado grande puede causar divergencia u oscilación; aplicar descenso por gradiente básico a problemas mal condicionados produce convergencia muy lenta; ignorar la no convexidad puede atrapar iterados en puntos silla o mínimos locales pobres.

Consecuencia

Consecuencia
Con selección adecuada del paso y regularidad del problema, el descenso por gradiente converge a puntos estacionarios y proporciona un algoritmo sencillo y escalable para optimización a gran escala y aprendizaje automático.

Inversión

Inversión
La noción opuesta es el ascenso por gradiente, que se mueve a lo largo del gradiente para aumentar la función objetivo; de forma más drástica, métodos de segundo orden o quasi-Newton sustituyen la dirección de mayor pendiente por direcciones informadas por la curvatura.

Límite

Límite
Requiere diferenciabilidad (o generalizaciones por subgradiente) del objetivo y condiciones de Lipschitz o convexidad para garantías globales; excluye problemas con variables discretas salvo que se relajen.

Tensión semántica

Tensión semántica
Compite con descenso por coordenadas, métodos estocásticos y métodos tipo Newton: el descenso por gradiente es simple y de bajo coste de memoria, pero puede ser más lento que métodos con información de curvatura o variantes estocásticas en regímenes de grandes datos.

Síntesis

Síntesis
El descenso por gradiente es el algoritmo de descenso de primer orden por excelencia: calcular el gradiente local, elegir una longitud de paso coherente con estabilidad y progreso, e iterar para reducir la función objetivo, a cambio de simplicidad y escalabilidad frente a posible lentitud en paisajes mal condicionados o no convexos.