homeproject
blog
search..K
search..K

Navigation

Home
Projects
Writings

Connect

Email
GitHub
Twitter / X
LinkedIn

Latest Writing

04 Articles
01/Deep Learning Foundations: Gradient Descent, Multilayer Backpropagation Calculus & Loss Optimization
02/How Neural Networks Learn: Activation Functions, Weight Initialization & Optimization Dynamics
03/Mermaid Architectural Diagram Studio: Full Design & Color Stress Test
04/Calculus & Geometry: 2D Function Analysis, Tangent Slopes & Interactive Curve Plotting

© 2026 Ayush Kumar.•All rights reserved.

Sitemap•

Built with Next.js & Tailwind

How Neural Networks Learn: Activation Functions, Weight Initialization & Optimization Dynamics
Home/Writings/Deep Learning & Neural Networks

How Neural Networks Learn: Activation Functions, Weight Initialization & Optimization Dynamics

Machine LearningNeural NetworksDeep LearningOptimizationAIMathematics

Without non-linear activation functions, a neural network with 100 hidden layers is mathematically equivalent to a single linear regression model. Learning happens at the intersection of non-linear transformations, proper weight variance preservation, and adaptive gradient optimization.

Training deep neural networks requires coordinating three fundamental building blocks: non-linear activation functions, variance-preserving weight initializations, and adaptive first/second-order optimization algorithms.

Series·Deep Learning & Neural Networks
Chapter 2 of 2
1Deep Learning Foundations: Gradient Descent, Multilayer Backpropagation Calculus & Loss Optimization
Read →
2How Neural Networks Learn: Activation Functions, Weight Initialization & Optimization Dynamics
Current
Previous
Deep Learning Foundations: Gradient Descent, Multilayer Backpropagation Calculus & Loss Optimization
Final chapter in series
How Neural Networks Learn Technical Illustration
Figure 1: Conceptual mapping of activation landscapes, weight initialization variances, and gradient descent trajectory.

1. Activation Functions: Introducing Non-Linearity

Without activation functions, matrix multiplications accumulate into a single linear map:

y=W3(W2(W1x+b1)+b2)+b3=Wnetx+bnet\mathbf{y} = \mathbf{W}_3 (\mathbf{W}_2 (\mathbf{W}_1 \mathbf{x} + \mathbf{b}_1) + \mathbf{b}_2) + \mathbf{b}_3 = \mathbf{W}_{net} \mathbf{x} + \mathbf{b}_{net}y=W3​(W2​(W1​x+b1​)+b2​)+b3​=Wnet​x+bnet​

Activation functions σ(z)\sigma(z)σ(z) break this linearity, enabling networks to approximate arbitrary continuous functions (The Universal Approximation Theorem).

Classic Activation Landscapes

  1. Sigmoid: σ(z)=11+e−z\sigma(z) = \frac{1}{1 + e^{-z}}σ(z)=1+e−z1​ (vanishes gradients for ∣z∣>4|z| > 4∣z∣>4)
  2. Hyperbolic Tangent (Tanh): tanh⁡(z)=ez−e−zez+e−z\tanh(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}}tanh(z)=ez+e−zez−e−z​ (zero-centered)
  3. Rectified Linear Unit (ReLU): f(z)=max⁡(0,z)f(z) = \max(0, z)f(z)=max(0,z) (prevents vanishing gradients for z>0z > 0z>0)
Activation Functions Comparison: Sigmoid, Tanh & ReLU
y = 1 / (1 + exp(-x))y = Math.max(0y = x)y = Math.tanh(x)
Curves:
-6-4-2246-4-224
Hover cursor over graph to inspect coordinates

2. Weight Initialization: Preserving Variance Across Layers

If weight matrices are initialized too large, activations explode (1.5100→∞1.5^{100} \to \infty1.5100→∞). If initialized too small, activations collapse to zero (0.5100→00.5^{100} \to 00.5100→0).

To prevent vanishing and exploding gradients during forward and backward passes, we initialize weights so that variance is preserved from layer to layer:

Var(z(l))=Var(a(l−1))\text{Var}(z^{(l)}) = \text{Var}(a^{(l-1)})Var(z(l))=Var(a(l−1))

Xavier (Glorot) Initialization (for Sigmoid / Tanh)

For a layer with ninn_{\text{in}}nin​ inputs and noutn_{\text{out}}nout​ outputs, weights are drawn from a normal distribution with variance:

Wi,j∼N(0, 2nin+nout)\mathbf{W}_{i,j} \sim \mathcal{N}\left(0, \, \frac{2}{n_{\text{in}} + n_{\text{out}}}\right)Wi,j​∼N(0,nin​+nout​2​)

He (Kaiming) Initialization (for ReLU)

Because ReLU zero-out half of all negative inputs (halving the variance), He initialization compensates by doubling the variance:

Wi,j∼N(0, 2nin)\mathbf{W}_{i,j} \sim \mathcal{N}\left(0, \, \frac{2}{n_{\text{in}}}\right)Wi,j​∼N(0,nin​2​)


3. Interactive Neural Learning Lab

Simulate forward activation flow, loss computation, backpropagation error deltas, and real-time weight matrix updates using the interactive laboratory below:

Deep Neural Network & Backpropagation Engine

Architecture: 3 → 4 → 3 → 1 | Epoch: 0 | Loss: 0.10733

η:0.1
0.80-0.500.400.570.540.450.470.320.780.240.49
Real-Time Loss Convergence
Press Step or Train to record loss trajectory
Neuron Inspector

Click any neuron node in the graph to inspect exact linear sum z, activation a, and backprop delta δ.


4. Adaptive Optimization Algorithms

Standard Stochastic Gradient Descent (SGD) updates weights along the negative gradient direction:

Wt+1=Wt−η⋅∇WL(Wt)\mathbf{W}_{t+1} = \mathbf{W}_t - \eta \cdot \nabla_{\mathbf{W}} \mathcal{L}(\mathbf{W}_t)Wt+1​=Wt​−η⋅∇W​L(Wt​)

In non-convex, high-dimensional loss landscapes with ravines and saddle points, modern adaptive optimizers accelerate convergence:

Adam (Adaptive Moment Estimation)

Adam maintains moving averages of both the first moment (mean mtm_tmt​) and second moment (uncentered variance vtv_tvt​) of gradients:

mt=β1mt−1+(1−β1)gtm_t = \beta_1 m_{t-1} + (1 - \beta_1) g_tmt​=β1​mt−1​+(1−β1​)gt​

vt=β2vt−1+(1−β2)gt2v_t = \beta_2 v_{t-1} + (1 - \beta_2) g_t^2vt​=β2​vt−1​+(1−β2​)gt2​

With bias correction:

m^t=mt1−β1t,v^t=vt1−β2t\hat{m}_t = \frac{m_t}{1 - \beta_1^t}, \quad \hat{v}_t = \frac{v_t}{1 - \beta_2^t}m^t​=1−β1t​mt​​,v^t​=1−β2t​vt​​

Wt+1=Wt−ηv^t+ϵm^t\mathbf{W}_{t+1} = \mathbf{W}_t - \frac{\eta}{\sqrt{\hat{v}_t} + \epsilon} \hat{m}_tWt+1​=Wt​−v^t​​+ϵη​m^t​


Summary

  • Activation Functions: Use ReLU or LeakyReLU by default for hidden layers to prevent vanishing gradients.
  • Initialization: Match activation functions with appropriate initializers (He for ReLU, Xavier for Tanh/Sigmoid).
  • Optimization: Use Adam (η=10−3\eta = 10^{-3}η=10−3) for rapid prototyping and non-convex landscapes, or SGD with Momentum (β=0.9\beta = 0.9β=0.9) for optimal generalization on vision tasks.
Previous Chapter
Deep Learning Foundations: Gradient Descent, Multilayer Backpropagation Calculus & Loss Optimization
Final chapter in series
Recommended Reading

Hand-picked related technical articles

Deep Learning Foundations: Gradient Descent, Multilayer Backpropagation Calculus & Loss Optimization
Machine LearningNeural Networks
Deep Learning Foundations: Gradient Descent, Multilayer Backpropagation Calculus & Loss Optimization

A rigorous, mathematical and architectural deep dive into artificial neural networks, multivariable vector calculus, gradient descent dynamics, backpropagation derivations, and interactive loss landscape optimization.

Aug 15, 2026
Read Article
Next.js App Router: Performance Optimization
Next.jsPerformance
Next.js App Router: Performance Optimization

Learn how to optimize your Next.js App Router applications for maximum performance.

Apr 11, 2026
Read Article
Geometric Mastery: Circle Equations, Parametric Geometry & Interactive Proofs
GeometryMathematics
Geometric Mastery: Circle Equations, Parametric Geometry & Interactive Proofs

A mathematical deep dive into circle equations—exploring standard forms, general second-degree forms, parametric vectors, tangent lines, and interactive diagrammatic proofs.

Aug 5, 2026
Read Article
Calculus & Geometry: 2D Function Analysis, Tangent Slopes & Interactive Curve Plotting
GeometryCalculus
Calculus & Geometry: 2D Function Analysis, Tangent Slopes & Interactive Curve Plotting

A mathematical deep dive into 2D explicit and implicit curves—exploring polynomial roots, trigonometric waves, derivative tangent slopes, and real-time interactive 2D graph visualization.

Aug 14, 2026
Read Article