Repository navigation
Expand file tree
/
Copy pathUDL_Equations.tex
More file actions
2229 lines (1721 loc) · 118 KB
/
Copy pathUDL_Equations.tex
File metadata and controls
2229 lines (1721 loc) · 118 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
936
937
938
939
940
941
942
943
944
945
946
947
948
949
950
951
952
953
954
955
956
957
958
959
960
961
962
963
964
965
966
967
968
969
970
971
972
973
974
975
976
977
978
979
980
981
982
983
984
985
986
987
988
989
990
991
992
993
994
995
996
997
998
999
1000
\documentclass[letterpaper,twoside,openany, titlepage,oldfontcommands,titles,dvipsnames]{memoir}
\usepackage{amsmath}
\usepackage{amsfonts}
\usepackage{color}
\newcommand*\mystrut[1]{\vrule width0pt height0pt depth#1\relax}
\setstocksize{11in}{8.5in}
\settrimmedsize{9in}{8in}{*}
\setlength{\trimtop}{1in}
\setlength{\trimedge}{0.25in}
\setlength{\textheight}{7.5in}
\setlength{\textwidth}{5.3125in}
\setlrmargins{*}{*}{1.5}
\setulmargins{0.905in}{*}{*}
\setlength{\marginparsep}{0mm}
\setlength{\marginparwidth}{1mm}
\title{Understanding Deep Learning Equations}
\begin{document}
\maketitle
\chapter{Introduction}
\chapter{Supervised Learning}
\begin{eqnarray}
\mathbf{y} = \mbox{\bf f}[\mathbf{x}].
\end{eqnarray}
\begin{eqnarray}
\mathbf{y} = \mbox{\bf f}[\mathbf{x}, \boldsymbol\phi].
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\Bigl[L\left[\boldsymbol\phi\right] \Bigr].
\end{eqnarray}
\begin{eqnarray}\label{eq:sl_linear_regression}
y &=& \mbox{f}[x,\boldsymbol\phi]\nonumber \\
&=&\phi_{0}+\phi_{1}x.
\end{eqnarray}
\begin{eqnarray}\
L[\boldsymbol\phi] &=& \sum_{i=1}^{I} \left(\mbox{f}[x_{i}, \boldsymbol\phi]-y_{i}\right)^{2}\nonumber \\
&=& \sum_{i=1}^{I} \left(\phi_{0}+\phi_{1}x_i-y_{i}\right)^{2}.\label{eq:sl_loss_function}
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} &=& \mathop{\rm argmin}_{\boldsymbol\phi}\Bigl[L[\boldsymbol\phi]\Bigr]\nonumber \\
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[\sum_{i=1}^{I} \left(\mbox{f}[x_{i}, \boldsymbol\phi]-y_{i}\right)^{2}\right]\nonumber \\
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[\sum_{i=1}^{I} \left(\phi_{0}+\phi_{1}x_i-y_{i}\right)^{2}\right].
\end{eqnarray}
\chapter{Shallow neural networks}
\begin{eqnarray}\label{eq:snn_simple_eq}
y &=& \mbox{f}[x,\boldsymbol\phi]\nonumber \\
&=&\phi_{0}+\phi_{1}\mbox{a}[\theta_{10} + \theta_{11}x]+\phi_{2}\mbox{a}[\theta_{20} + \theta_{21}x]+\phi_{3}\mbox{a}[\theta_{30} + \theta_{31}x].
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_relu}
\mbox{a}[z] = \mbox{ReLU}[z] = \begin{cases} 0 & \quad z <0 \\ z & \quad z\geq 0\end{cases}.
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_simple_eq1b}
h_{1} &=& \mbox{a}[\theta_{10} + \theta_{11}x] \nonumber \\
h_{2} &=& \mbox{a}[\theta_{20} + \theta_{21}x] \nonumber \\
h_{3} &=& \mbox{a}[\theta_{30} + \theta_{31}x],
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_simple_eq2}
y = \phi_{0}+\phi_{1}h_{1}+\phi_{2}h_{2}+\phi_{3}h_{3}.
\end{eqnarray}
\begin{eqnarray}
h_{d} = \mbox{a}[\theta_{d0} + \theta_{d1}x],
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_many_hidden}
y = \phi_{0}+\sum_{d=1}^{D}\phi_{d}h_{d}.
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_multiple_out2}
h_{1} &=& \mbox{a}[\theta_{10} + \theta_{11}x] \nonumber \\
h_{2} &=& \mbox{a}[\theta_{20} + \theta_{21}x] \nonumber \\
h_{3} &=& \mbox{a}[\theta_{30} + \theta_{31}x] \nonumber \\
h_{4} &=& \mbox{a}[\theta_{40} + \theta_{41}x],
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_multiple_out1}
y_1 &=& \phi_{10}+\phi_{11}h_{1}+\phi_{12}h_{2}+\phi_{13}h_{3}+\phi_{14}h_{4}\nonumber \\
y_2 &=& \phi_{20}+\phi_{21}h_{1}+\phi_{22}h_{2}+\phi_{23}h_{3}+\phi_{24}h_{4}.
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_multiple3}
h_{1} &=& \mbox{a}[\theta_{10} + \theta_{11}x_1+ \theta_{12}x_2] \nonumber \\
h_{2} &=& \mbox{a}[\theta_{20} + \theta_{21}x_1+\theta_{22}x_2] \nonumber \\
h_{3} &=& \mbox{a}[\theta_{30} + \theta_{31}x_1+\theta_{32}x_2],
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_multiple4}
y = \phi_{0}+\phi_{1}h_{1}+\phi_{2}h_{2}+\phi_{3}h_{3}.
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_general_1}
h_{d} = \mbox{a}\left[\theta_{d0} + \sum_{i=1}^{D_{i}}\theta_{di}x_i\right],
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_general_2}
y_j = \phi_{j0}+\sum_{d=1}^{D}\phi_{jd}h_{d},
\end{eqnarray}
\begin{eqnarray}\label{eq:snn_harswish}
\mbox{HardSwish}[z] = \begin{cases} 0 & \quad z <-3 \\ z(z+3)/6 & \quad -3\leq z\leq 3 \\ z &\quad z>3 \end{cases}.
\end{eqnarray}
\begin{eqnarray}
\mbox{ReLU}[\alpha \cdot z] = \alpha \cdot \mbox{ReLU}[z].
\end{eqnarray}
\begin{eqnarray}
\mbox{heaviside}[z] = \begin{cases} 0 & \quad z <0 \\ 1 & \quad z\geq 0\end{cases} \hspace{2cm} \mbox{rect}[z] = \begin{cases} 0 & \quad z < 0 \\ 1 & \quad 0 \leq z\leq 1 \\ 0 & \quad z > 1\end{cases}.
\end{eqnarray}
\chapter{Deep neural networks}
\begin{eqnarray}\label{eq:dnn_comp_in}
h_{1} &=& \mbox{a}[\theta_{10} + \theta_{11}x] \nonumber \\
h_{2} &=& \mbox{a}[\theta_{20} + \theta_{21}x] \nonumber \\
h_{3} &=& \mbox{a}[\theta_{30} + \theta_{31}x],
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_comp}
y = \phi_{0}+\phi_{1}h_{1}+\phi_{2}h_{2}+\phi_{3}h_{3}.
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_comp_2}
h'_{1} &=& \mbox{a}[\theta'_{10} + \theta'_{11}y] \nonumber \\
h'_{2} &=& \mbox{a}[\theta'_{20} + \theta'_{21}y] \nonumber \\
h'_{3} &=& \mbox{a}[\theta'_{30} + \theta'_{31}y],
\end{eqnarray}
\begin{eqnarray} \label{eq:dnn_comp_out}
y' = \phi'_{0}+\phi'_{1}h'_{1}+\phi'_{2}h'_{2}+\phi'_{3}h'_{3}.
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_deep_linear}
h'_{1} &=\quad \mbox{a}[\theta'_{10} + \theta'_{11}y] &=\quad \mbox{a}[\theta'_{10} + \theta'_{11}\phi_{0}+\theta'_{11}\phi_{1}h_{1}+\theta'_{11}\phi_{2}h_{2}+\theta'_{11}\phi_{3}h_{3}] \nonumber \\
h'_{2} &= \quad\mbox{a}[\theta'_{20} + \theta'_{21}y] &=\quad \mbox{a}[\theta'_{20} + \theta'_{21}\phi_{0}+\theta'_{21}\phi_{1}h_{1}+\theta'_{21}\phi_{2}h_{2}+\theta'_{21}\phi_{3}h_{3}] \nonumber \\
h'_{3} &=\quad \mbox{a}[\theta'_{30} + \theta'_{31}y] &=\quad \mbox{a}[\theta'_{30} + \theta'_{31}\phi_{0}+\theta'_{31}\phi_{1}h_{1}+\theta'_{31}\phi_{2}h_{2}+\theta'_{31}\phi_{3}h_{3}],
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_three_layer_middle}
h'_{1} &=& \mbox{a}[\psi_{10} + \psi_{11}h_{1}+ \psi_{12}h_{2}+ \psi_{13}h_{3}] \nonumber \\
h'_{2} &=& \mbox{a}[\psi_{20} + \psi_{21}h_{1}+ \psi_{22}h_{2}+ \psi_{23}h_{3}] \nonumber \\
h'_{3} &=& \mbox{a}[\psi_{30} + \psi_{31}h_{1}+ \psi_{32}h_{2}+ \psi_{33}h_{3}],
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_three_layer_in}
h_{1} &=& \mbox{a}[\theta_{10} + \theta_{11}x] \nonumber \\
h_{2} &=& \mbox{a}[\theta_{20} + \theta_{21}x] \nonumber \\
h_{3} &=& \mbox{a}[\theta_{30} + \theta_{31}x],
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_three_layer_middle2}
h'_{1} &=& \mbox{a}[\psi_{10} + \psi_{11}h_{1}+ \psi_{12}h_{2}+ \psi_{13}h_{3}] \nonumber \\
h'_{2} &=& \mbox{a}[\psi_{20} + \psi_{21}h_{1}+ \psi_{22}h_{2}+ \psi_{23}h_{3}] \nonumber \\
h'_{3} &=& \mbox{a}[\psi_{30} + \psi_{31}h_{1}+ \psi_{32}h_{2}+ \psi_{33}h_{3}],
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_three_layer_out}
y' = \phi'_{0}+\phi'_{1}h'_{1}+\phi'_{2}h'_{2}+\phi'_{3}h'_{3}.
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_expanded}
y' &=& \phi'_{0}+\phi'_{1}\mbox{a}\left[\psi_{10} + \psi_{11}\mbox{a}[\theta_{10} + \theta_{11}x] + \psi_{12}\mbox{a}[\theta_{20} + \theta_{21}x]+ \psi_{13}\mbox{a}[\theta_{30} + \theta_{31}x]\right]\nonumber \\
&&\hspace{0.55cm}+\phi'_{2}\mbox{a}[\psi_{20} + \psi_{21}\mbox{a}[\theta_{10} + \theta_{11}x] + \psi_{22}\mbox{a}[\theta_{20} + \theta_{21}x]+ \psi_{23}\mbox{a}[\theta_{30} + \theta_{31}x]] \nonumber\\
&&\hspace{0.55cm}+\phi'_{3}\mbox{a}[\psi_{30} + \psi_{31}\mbox{a}[\theta_{10} + \theta_{11}x] + \psi_{32}\mbox{a}[\theta_{20} + \theta_{21}x]+ \psi_{33}\mbox{a}[\theta_{30} + \theta_{31}x]],\nonumber \\
\end{eqnarray}
\begin{eqnarray}
\begin{bmatrix}
h_{1} \\ h_{2} \\ h_{3}
\end{bmatrix}
= \mbox{\bf a}\left[\begin{bmatrix}\theta_{10}\\ \theta_{20}\\ \theta_{30} \end{bmatrix}+\begin{bmatrix}\theta_{11}\\\theta_{21}\\\theta_{31}\end{bmatrix}x\right],
\end{eqnarray}
\begin{eqnarray}
\begin{bmatrix}
h'_{1} \\ h'_{2} \\h'_{3}
\end{bmatrix}
=\mbox{\bf a}\left[\begin{bmatrix}\psi_{10} \\ \psi_{20}\\ \psi_{30}\end{bmatrix} + \begin{bmatrix}\psi_{11} &\psi_{12} & \psi_{13} \\\psi_{21} &\psi_{22} & \psi_{23} \\\psi_{31} &\psi_{32} & \psi_{33} \end{bmatrix} \begin{bmatrix}
h_{1} \\ h_{2} \\ h_{3}
\end{bmatrix} \right],
\end{eqnarray}
\begin{eqnarray}
y' = \phi'_{0} + \begin{bmatrix} \phi'_{1} & \phi'_{2} & \phi'_{3} \end{bmatrix}\begin{bmatrix}h'_{1} \\ h'_{2} \\h'_{3} \end{bmatrix},
\end{eqnarray}
\begin{eqnarray}
\mathbf{h} &=& \mbox{\bf a}\left[\boldsymbol\theta_{0}+\boldsymbol\theta x\right] \nonumber\\
\mathbf{h}' &=& \mbox{\bf a}\left[\boldsymbol\psi_{0}+\boldsymbol\Psi \mathbf{h}\right] \nonumber \\
y' &=& \phi'_{0} + \boldsymbol\phi' \mathbf{h}',
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_la1}
\mathbf{h}_{1} &=& \mathbf{a}[\boldsymbol\beta_{0} +\boldsymbol\Omega_{0}\mathbf{x}]\nonumber \\
\mathbf{h}_{2} &=& \mathbf{a}[\boldsymbol\beta_{1} +\boldsymbol\Omega_{1}\mathbf{h}_{1}]\nonumber \\
\mathbf{h}_{3} &=& \mathbf{a}[\boldsymbol\beta_{2} +\boldsymbol\Omega_{2}\mathbf{h}_{2}]\nonumber \\
&\vdots&\nonumber\\
\mathbf{h}_{K} &=& \mathbf{a}[\boldsymbol\beta_{K-1} +\boldsymbol\Omega_{K-1}\mathbf{h}_{K-1}] \nonumber\\
\mathbf{y} &=& \boldsymbol\beta_{K} +\boldsymbol\Omega_{K}\mathbf{h}_{K}.
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_la2}
\mathbf{y}\!\! &\!\!=\!\!& \!\!\boldsymbol\beta_{K} +\boldsymbol\Omega_{K}\mathbf{a}\left[\boldsymbol\beta_{K-1} +\boldsymbol\Omega_{K-1}\mathbf{a}\left[\ldots
\boldsymbol\beta_{2} +\boldsymbol\Omega_{2}\mathbf{a}\left[\boldsymbol\beta_{1} +\boldsymbol\Omega_{1}\mathbf{a}\left[\boldsymbol\beta_{0} +\boldsymbol\Omega_{0}\mathbf{x}\right]\right]\ldots\right]\right].\nonumber \\
\end{eqnarray}
\begin{eqnarray}\label{eq:dnn_deep_param_calc}
N_{r} = \left(\frac{D}{D_{i}}+1\right)^{D_{i}(K-1)}\cdot\sum_{j=0}^{D_{i}}\binom{D}{j}.
\end{eqnarray}
\begin{eqnarray}
\mbox{ReLU}\Bigl[\boldsymbol\beta_{1}\!+\!\lambda_1\!\cdot\!\boldsymbol\Omega_{1}\mbox{ReLU}\left[\boldsymbol\beta_{0}\!+\!\lambda_{0}\cdot\boldsymbol\Omega_{0}\mathbf{x}\right] \Bigr]\!=\! \lambda_0\lambda_{1}\cdot \mbox{ReLU}\left[\frac{1}{\lambda_0\lambda_1}\boldsymbol\beta_{1}\!+\!\boldsymbol\Omega_{1}\mbox{ReLU}\left[\frac{1}{\lambda_0}\boldsymbol\beta_{0}\!+\!\boldsymbol\Omega_{0}\mathbf{x}\right]\right],
\end{eqnarray}
\chapter{Loss functions}
\begin{eqnarray}\label{eq:loss_max_like1}
\hat{\boldsymbol\phi} &=& \mathop{\rm argmax}_{\boldsymbol\phi}\left[\prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mathbf{x}_{i})\right]\nonumber\\
&=& \mathop{\rm argmax}_{\boldsymbol\phi}\left[\prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\boldsymbol\theta_{i})\right] \nonumber \\ &=& \mathop{\rm argmax}_{\boldsymbol\phi}\left[\prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\right].
\end{eqnarray}
\begin{eqnarray}
Pr(\mathbf{y}_{1},\mathbf{y}_{2},\ldots, \mathbf{y}_{I}|\mathbf{x}_{1},\mathbf{x}_{2},\ldots,\mathbf{x}_{I}) = \prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mathbf{x}_{i}).
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_max_like2}
\hat{\boldsymbol\phi} &=& \mathop{\rm argmax}_{\boldsymbol\phi}\left[\prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\right] \nonumber \\
&=& \mathop{\rm argmax}_{\boldsymbol\phi}\left[\log\left[\prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\right]\right]\nonumber \\
&=& \mathop{\rm argmax}_{\boldsymbol\phi}\left[\sum_{i=1}^{I} \log\Bigl[Pr(\mathbf{y}_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\Bigr]\right].
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi}
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} \log\Bigl[Pr(\mathbf{y}_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\Bigr]\right]\nonumber \\
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\Bigl[L[\boldsymbol\phi]\Bigr],
\end{eqnarray}
\begin{eqnarray}
\hat{\mathbf{y}} = \mathop{\rm argmax}_{\mathbf{y}}\Bigl[Pr(\mathbf{y}|\mbox{\bf f}[\mathbf{x},\hat{\boldsymbol\phi}])\Bigr].
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\Bigl[L[\boldsymbol\phi]\Bigr] = \mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} \log\Bigl[Pr(\mathbf{y}_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\Bigr]\right].
\end{eqnarray}
\begin{eqnarray}
Pr(y|\mu,\sigma^2) = \frac{1}{\sqrt{2\pi\sigma^{2}}}\exp\left[-\frac{(y-\mu)^{2}}{2\sigma^{2}}\right].
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_pdf_uni_reg}
Pr(y|\mbox{f}[\mathbf{x},\boldsymbol\phi],\sigma^2) = \frac{1}{\sqrt{2\pi\sigma^{2}}}\exp\left[-\frac{(y-\mbox{f}[\mathbf{x},\boldsymbol\phi])^{2}}{2\sigma^{2}}\right].
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_normal_full}
L[\boldsymbol\phi] &=& -\sum_{i=1}^{I} \log\left[Pr(y_{i}|\mbox{f}[\mathbf{x}_{i},\boldsymbol\phi],\sigma^{2})\right]\nonumber \\
&=&-\sum_{i=1}^{I} \log\left[\frac{1}{\sqrt{2\pi\sigma^{2}}}\exp\left[-\frac{(y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^{2}}{2\sigma^{2}}\right]\right].
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_normal_full2}
\hat{\boldsymbol\phi} &=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} \log\left[\frac{1}{\sqrt{2\pi\sigma^{2}}}\exp\left[-\frac{(y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^{2}}{2\sigma^{2}}\right]\right]\right]
\nonumber \\
&=&\mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} \left(\log\left[\frac{1}{\sqrt{2\pi\sigma^{2}}}\right] -\frac{(y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^{2}}{2\sigma^{2}}\right)\right]\nonumber \\
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} -\frac{(y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^{2}}{2\sigma^{2}}\right]\nonumber \\
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[\sum_{i=1}^{I} (y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^{2}\right],
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_least_squares}
L[\boldsymbol\phi] = \sum_{i=1}^{I} \bigl(y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi]\bigr)^{2}.
\end{eqnarray}
\begin{eqnarray}
\hat{y} = \mathop{\rm argmax}_{y}\left[Pr(y|\mbox{f}[\mathbf{x},\hat{\boldsymbol\phi}],\sigma^2)\right].
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi},\hat{\sigma}^{2} = \mathop{\rm argmin}_{\boldsymbol\phi,\sigma^{2}}\left[-\sum_{i=1}^{I} \log\left[\frac{1}{\sqrt{2\pi\sigma^{2}}}\exp\left[-\frac{(y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^{2}}{2\sigma^{2}}\right]\right]\right].
\end{eqnarray}
\begin{eqnarray}
\mu &=& \mbox{f}_1[\mathbf{x},\boldsymbol\phi] \nonumber \\
\sigma^2 &=& \mbox{f}_2[\mathbf{x},\boldsymbol\phi]^2,
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} \biggl(\log\left[\frac{1}{\sqrt{2\pi\mbox{f}_2[\mathbf{x}_i,\boldsymbol\phi]^2}}\right] -\frac{(y_i-\mbox{f}_1[\mathbf{x}_i,\boldsymbol\phi])^{2}}{2\mbox{f}_2[\mathbf{x}_i,\boldsymbol\phi]^2}\biggr)\right].
\end{eqnarray}
\begin{eqnarray}
Pr(y|\lambda) = \begin{cases} 1-\lambda & \quad y =0 \\ \lambda & \quad y= 1\end{cases},
\end{eqnarray}
\begin{eqnarray}
Pr(y|\lambda) = (1-\lambda)^{1-y}\cdot \lambda^{y}.
\end{eqnarray}
\begin{eqnarray}\label{eq:logistic_sigmoid}
\mbox{sig}[z] = \frac{1}{1+\exp[-z]}.
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_binary}
Pr(y|\mathbf{x}) = (1-\mbox{sig}[\mbox{f}[\mathbf{x},\boldsymbol\phi]])^{1-y}\cdot \mbox{sig}[\mbox{f}[\mathbf{x},\boldsymbol\phi]]^y.
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_binary_cross_entropy}
L[\boldsymbol\phi] = \sum_{i=1}^{I}-(1-y_{i})\log\Bigl[1-\mbox{sig}[\mbox{f}[\mathbf{x}_i,\boldsymbol\phi]]\Bigr] - y_{i}\log\Bigl[\mbox{sig}[\mbox{f}[\mathbf{x}_i,\boldsymbol\phi]]\Bigr].
\end{eqnarray}
\begin{eqnarray}
Pr(y=k) = \lambda_{k}.
\end{eqnarray}
\begin{eqnarray}
\mbox{softmax}_{k}[\mathbf{z}] = \frac{\exp[z_{k}]}{\sum_{k'=1}^{K}\exp[z_{k'}]},
\end{eqnarray}
\begin{eqnarray}
Pr(y=k|\mathbf{x}) = \mbox{softmax}_{k}\Bigr[\mbox{\bf f}[\mathbf{x},\boldsymbol\phi]\Bigl].
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_multiclass_class}
L[\boldsymbol\phi] &=& -\sum_{i=1}^{I}\log\left[\mbox{softmax}_{y_{i}}\Bigl[\mbox{\bf f}\left[\mathbf{x}_i,\boldsymbol\phi\right]\Bigr]\right]\nonumber\\
&=& -\sum_{i=1}^{I}\left(\mbox{f}_{y_{i}}\left[\mathbf{x}_i,\boldsymbol\phi\right]-\log\left[\sum_{k'=1}^{K}\exp\left[\mbox{ f}_{k'}\left[\mathbf{x}_i,\boldsymbol\phi\right]\right]\right]\right),
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_multiple}
Pr(\mathbf{y}|\mbox{\bf f}[\mathbf{x},\boldsymbol\phi])= \prod_{d}Pr(y_{d}|\mbox{\bf f}_d[\mathbf{x},\boldsymbol\phi]),
\end{eqnarray}
\begin{eqnarray}
L[\boldsymbol\phi] = -\sum_{i=1}^{I}\log\Bigl[Pr(\mathbf{y}_i|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\Bigr]= -\sum_{i=1}^{I}\sum_{d}\log\Bigl[Pr(y_{id}|\mbox{\bf f}_d[\mathbf{x}_{i},\boldsymbol\phi])\Bigr].
\end{eqnarray}
\begin{eqnarray}
D_{KL}\bigl[q||p\bigr] = \int_{-\infty}^{\infty}q(z) \log\bigl[q(z)\bigr]dz - \int_{-\infty}^{\infty}q(z) \log\bigl[p(z)\bigr]dz.
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_cross_entropy_empirical}
q(y) = \frac{1}{I} \sum_{i=1}^{I} \delta[y-y_{i}],
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\theta} &=& \mathop{\rm argmin}_{\boldsymbol\theta}\left[ \int_{-\infty}^{\infty}q(y) \log\bigl[q(y)\bigr]dy - \int_{-\infty}^{\infty}q(y) \log\bigl[Pr(y|\boldsymbol\theta)\bigr] dy\right] \nonumber \\
&=&\mathop{\rm argmin}_{\boldsymbol\theta}\left[- \int_{-\infty}^{\infty}q(y) \log\bigl[Pr(y|\boldsymbol\theta)\bigr] dy\right],
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_cross_deriv}
\hat{\boldsymbol\theta} &=& \mathop{\rm argmin}_{\theta}\left[-\int_{-\infty}^{\infty}\left(\frac{1}{I} \sum_{i=1}^{I} \delta[y-y_{i}]\right)\log\bigl[Pr(y|\boldsymbol\theta)\bigr]dy\right] \nonumber\\
&=&\mathop{\rm argmin}_{\boldsymbol\theta}\left[-\frac{1}{I} \sum_{i=1}^{I} \log\bigl[Pr(y_i|\boldsymbol\theta)\bigr]\right]\nonumber\\
&=&\mathop{\rm argmin}_{\boldsymbol\theta}\left[-\sum_{i=1}^{I} \log\bigl[Pr(y_i|\boldsymbol\theta)\bigr]\right].
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\left[-\sum_{i=1}^{I} \log\bigl[Pr(y_{i}|\mbox{\bf f}[\mathbf{x}_{i},\boldsymbol\phi])\bigr]\right].
\end{eqnarray}
\begin{eqnarray}\label{eq:loss_prob_sigmoid}
\mbox{sig}[z] = \frac{1}{1+\exp[-z]}.
\end{eqnarray}
\begin{eqnarray}
L = -(1-y)\log\Bigl[1-\mbox{sig}[\mbox{f}[\mathbf{x},\boldsymbol\phi]]\Bigr] - y\log\Bigl[\mbox{sig}[\mbox{f}[\mathbf{x},\boldsymbol\phi]]\Bigr],
\end{eqnarray}
\begin{eqnarray}
Pr(y|\mu,\kappa) = \frac{\exp\bigl[\kappa \cos[y-\mu]\bigr]}{2\pi \cdot \mbox{Bessel}_{0}[\kappa]} ,
\end{eqnarray}
\begin{eqnarray}
Pr(y|\lambda,\mu_1,\mu_2,\sigma^2_1,\sigma^2_2) = \frac{\lambda}{\sqrt{2\pi\sigma_1^{2}}}\exp\left[\frac{-(y-\mu_1)^{2}}{2\sigma_1^{2}}\right]+\frac{1-\lambda}{\sqrt{2\pi\sigma_2^{2}}}\exp\left[\frac{-(y-\mu_2)^{2}}{2\sigma_2^{2}}\right],
\end{eqnarray}
\begin{eqnarray}
Pr(y=k)=\frac{\lambda^{k}e^{-\lambda}}{k!}.
\end{eqnarray}
\chapter{Fitting models}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\Bigl[L[\boldsymbol\phi]\Bigr].
\end{eqnarray}
\begin{eqnarray}
\frac{\partial L}{\partial \boldsymbol\phi} = \begin{bmatrix}\frac{\partial L}{\partial \phi_{0}} \\[5pt] \frac{\partial L}{\partial \phi_{1}}\\ \vdots \\[5pt] \frac{\partial L}{\partial \phi_{N}}\end{bmatrix}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train_gradient_descent}
\boldsymbol\phi\longleftarrow\boldsymbol\phi - \alpha \cdot \frac{\partial L}{\partial \boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}
y &=& \mbox{f}[x,\boldsymbol\phi]\nonumber \\
&=& \phi_{0} + \phi_{1}x.
\end{eqnarray}
\begin{eqnarray}\label{eq:train_lr_cost_function}
L[\boldsymbol\phi] \hspace{0.2cm}= \hspace{0.2cm}\sum_{i=1}^{I} \ell_{i} &=& \sum_{i=1}^{I} \left(\mbox{f}[x_i,\boldsymbol\phi]-y_{i}\right)^{2}\nonumber \\
&=& \sum_{i=1}^{I} \left(\phi_{0}+\phi_{1}x_{i}-y_{i}\right)^{2},
\end{eqnarray}
\begin{eqnarray}\label{eq:train_linear_deriv1}
\frac{\partial L}{\partial \boldsymbol\phi} = \frac{\partial}{\partial \boldsymbol\phi}\sum_{i=1}^{I} \ell_{i} = \sum_{i=1}^{I} \frac{\partial \ell_{i}}{\partial \boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}\label{eq:train_linear_deriv2}
\frac{\partial \ell_{i}}{\partial \boldsymbol\phi} = \begin{bmatrix}\frac{\partial \ell_{i}}{\partial \phi_{0}}\\\vspace{-0.2cm}\\\frac{\partial \ell_{i}}{\partial \phi_{1}}\end{bmatrix} = \begin{bmatrix}2(\phi_{0}+\phi_{1}x_{i}-y_{i})\\ \vspace{-0.2cm}\\ 2x_{i}(\phi_{0}+\phi_{1}x_{i}-y_{i})\end{bmatrix}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train_gabor}
\mbox{f}[x,\boldsymbol\phi] = \sin[\phi_0 + 0.06\cdot\phi_{1}x]\cdot \exp\left(-\frac{(\phi_0+0.06\cdot\phi_{1}x)^2}{32.0}\right).
\end{eqnarray}
\begin{eqnarray}
L[\boldsymbol\phi] = \sum_{i=1}^{I}\left(\mbox{f}[x_{i},\boldsymbol\phi]-y_{i}\right)^2.
\end{eqnarray}
\begin{eqnarray}\label{eq:train_sgd}
\boldsymbol\phi_{t+1}\longleftarrow\boldsymbol\phi_{t} - \alpha \cdot \sum_{i\in\mathcal{B}_{t}}\frac{\partial \ell_{i}[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}\label{eq:train_momentum}
\mathbf{m}_{t+1} &\leftarrow& \beta \cdot \mathbf{m}_t + (1-\beta) \sum_{i\in\mathcal{B}_t}\frac{\partial \ell_{i}[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\nonumber \\
\boldsymbol\phi_{t+1} &\leftarrow&\boldsymbol\phi_{t} - \alpha \cdot \mathbf{m}_{t+1},
\end{eqnarray}
\begin{eqnarray}\label{eq:train_nesterov}
\mathbf{m}_{t+1} &\leftarrow& \beta \cdot \mathbf{m}_{t} + (1-\beta) \sum_{i\in\mathcal{B}_{t}}\frac{\partial \ell_{i}[\boldsymbol\phi_{t}-\alpha\beta\cdot\mathbf{m}_{t}]}{\partial \boldsymbol\phi}\nonumber \\
\boldsymbol\phi_{t+1} &\leftarrow&\boldsymbol\phi_{t} - \alpha\cdot \mathbf{m}_{t+1},
\end{eqnarray}
\begin{eqnarray}
\mathbf{m}_{t+1} &\leftarrow& \frac{\partial L[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\nonumber \\
\mathbf{v}_{t+1} &\leftarrow& \left(\frac{\partial L[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\right)^2.
\end{eqnarray}
\begin{eqnarray}
\boldsymbol\phi_{t+1} &\leftarrow & \boldsymbol\phi_{t} - \alpha \cdot \frac{\mathbf{m}_{t+1}}{\sqrt{\mathbf{v}_{t+1}}+\epsilon},
\end{eqnarray}
\begin{eqnarray}\label{eq:train_adam}
\mathbf{m}_{t+1} &\leftarrow& \beta \cdot \mathbf{m}_{t} + (1-\beta) \frac{\partial L[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\nonumber \\
\mathbf{v}_{t+1} &\leftarrow& \gamma \cdot \mathbf{v}_{t} + (1-\gamma) \left(\frac{\partial L[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\right)^2,
\end{eqnarray}
\begin{eqnarray}\label{eq:train_adam_modify}
\tilde{\mathbf{m}}_{t+1} &\leftarrow & \frac{\mathbf{m}_{t+1}}{1-\beta^{t+1}}\nonumber \\
\tilde{\mathbf{v}}_{t+1} &\leftarrow & \frac{\mathbf{v}_{t+1}}{1-\gamma^{t+1}}.
\end{eqnarray}
\begin{eqnarray}
\boldsymbol\phi_{t+1} &\leftarrow & \boldsymbol\phi_{t} - \alpha\cdot\frac{ \tilde{\mathbf{m}}_{t+1}}{\sqrt{\tilde{\mathbf{v}}_{t+1}}+\epsilon}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train_adam_final}
\mathbf{m}_{t+1} &\leftarrow& \beta \cdot \mathbf{m}_{t} + (1-\beta) \sum_{i\in\mathcal{B}_{t}}\frac{\partial \ell_i[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\nonumber \\
\mathbf{v}_{t+1} &\leftarrow& \gamma \cdot \mathbf{v}_{t} + (1-\gamma) \left(\sum_{i\in\mathcal{B}_{t}}\frac{\partial \ell_i[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi}\right)^2,
\end{eqnarray}
\begin{eqnarray}
\mathbf{H}[\boldsymbol\phi] = \begin{bmatrix} \frac{\partial^{2} L}{\partial\phi_{0}^{2}} & \frac{\partial^{2} L}{\partial\phi_{0}\partial\phi_{1}} &\hdots &\frac{\partial^{2} L}{\partial\phi_{0}\partial\phi_{N}}\\
\frac{\partial^{2} L}{\partial\phi_{1}\partial\phi_{0}} &\frac{\partial^{2} L}{\partial\phi_{1}^{2}} &\hdots&\frac{\partial^{2} L}{\partial\phi_{1}\partial\phi_{N}} \\ \vdots &\vdots & \ddots &\vdots\\
\frac{\partial^{2} L}{\partial\phi_{N}\partial\phi_{0}} &\frac{\partial^{2} L}{\partial\phi_{N}\partial\phi_{1}} &\hdots&\frac{\partial^{2} L}{\partial\phi_{N}^2} \end{bmatrix}.
\end{eqnarray}
\begin{eqnarray}
\mathbf{H}[\boldsymbol\phi] = \begin{bmatrix} \frac{\partial^{2} L}{\partial\phi_{0}^{2}} & \frac{\partial^{2} L}{\partial\phi_{0}\partial\phi_{1}}\\
\frac{\partial^{2} L}{\partial\phi_{1}\partial\phi_{0}} &\frac{\partial^{2} L}{\partial\phi_{1}^{2}} \end{bmatrix},
\end{eqnarray}
\begin{eqnarray}
Pr(y=1|x) = \mbox{sig}[\phi_{0}+\phi_{1}x],
\end{eqnarray}
\begin{eqnarray}
\mbox{sig}[z] = \frac{1}{1+\exp[-z]}.
\end{eqnarray}
\begin{eqnarray}
\mbox{f}[x,\boldsymbol\phi] = \phi_{0}+\phi_{1}\mbox{a}[\theta_{10} + \theta_{11}x]+\phi_{2}\mbox{a}[\theta_{20} + \theta_{21}x]+\phi_{3}\mbox{a}[\theta_{30} + \theta_{31}x].
\end{eqnarray}
\chapter{Gradients and initialization}
\begin{eqnarray}
\mathbf{h}_{1} &=& \mathbf{a}[\boldsymbol\beta_{0} +\boldsymbol\Omega_{0}\mathbf{x}]\nonumber \\
\mathbf{h}_{2} &=& \mathbf{a}[\boldsymbol\beta_{1} +\boldsymbol\Omega_{1}\mathbf{h}_{1}] \nonumber\\
\mathbf{h}_{3} &=& \mathbf{a}[\boldsymbol\beta_{2} +\boldsymbol\Omega_{2}\mathbf{h}_{2}] \nonumber\\
\mbox{\bf f}[\mathbf{x},\boldsymbol\phi] &=& \boldsymbol\beta_{3} +\boldsymbol\Omega_{3}\mathbf{h}_{3},
\end{eqnarray}
\begin{eqnarray}
L[\boldsymbol\phi]= \sum_{i=1}^{I} \ell_{i}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_sgd}
\boldsymbol\phi_{t+1}\longleftarrow\boldsymbol\phi_{t} - \alpha \sum_{i\in\mathcal{B}_{t}}\frac{\partial \ell_{i}[\boldsymbol\phi_{t}]}{\partial \boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_{i}}{\partial\boldsymbol\beta_{k}} \quad\quad \mbox{and} \quad\quad \frac{\partial \ell_{i}}{\partial\boldsymbol\Omega_{k}},
\end{eqnarray}
\begin{eqnarray}
\mbox{f}[x,\boldsymbol\phi] = \beta_3+\omega_3\cdot\cos\Bigl[\beta_2+\omega_2\cdot\exp\bigl[\beta_1+\omega_1\cdot\sin[\beta_0+\omega_0\cdot x]\bigr]\Bigr],
\end{eqnarray}
\begin{eqnarray}
\ell_i = (\mbox{f}[x_i,\boldsymbol\phi]-y_i)^2,
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_i}{\partial \beta_{0}}, \quad \frac{\partial \ell_i}{\partial \omega_0}, \quad \frac{\partial \ell_i}{\partial \beta_{1}}, \quad \frac{\partial \ell_i}{\partial \omega_1}, \quad
\frac{\partial \ell_i}{\partial \beta_{2}}, \quad \frac{\partial \ell_i}{\partial \omega_{2}}, \quad \frac{\partial \ell_i}{\partial \beta_{3}}, \quad\mbox{and} \quad \frac{\partial \ell_i}{\partial \omega_{3}}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_complicated_deriv}
\frac{\partial \ell_i}{\partial \omega_{0}} &=& -2 \left( \beta_3+\omega_3\cdot\cos\Bigl[\beta_2+\omega_2\cdot\exp\bigl[\beta_1+\omega_1\cdot\sin[\beta_0+\omega_0\cdot x_i]\bigr]\Bigr]-y_i\right)\nonumber \\
&&\hspace{0.5cm}\cdot \omega_1\omega_2\omega_3\cdot x_i\cdot\cos[\beta_0+\omega_0 \cdot x_i]\cdot\exp\Bigl[\beta_1 + \omega_1 \cdot \sin[\beta_0+\omega_0\cdot x_i]\Bigr]\nonumber\\
&& \hspace{1cm}\cdot \sin\biggl[\beta_2+\omega_2\cdot \exp\Bigl[\beta_1 + \omega_1 \cdot \sin[\beta_0+\omega_0\cdot x_i]\Bigr]\biggr].
\end{eqnarray}
\begin{eqnarray}
f_{0} &=& \beta_{0} + \omega_{0}\cdot x_i\nonumber\\
h_{1} &=& \sin[f_{0}]\nonumber\\
f_{1} &=& \beta_{1} + \omega_{1}\cdot h_{1}\nonumber\\
h_{2} &=& \exp[f_{1}]\nonumber\\
f_{2} &=& \beta_{2} + \omega_{2} \cdot h_{2}\nonumber\\
h_{3} &=& \cos[f_{2}]\nonumber\\
f_{3} &=& \beta_{3} + \omega_{3}\cdot h_{3}\nonumber\\
\ell_{i} &=& (f_{3}-y_{i})^2.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_i}{\partial f_{3}}, \quad \frac{\partial \ell_i}{\partial h_3}, \quad \frac{\partial \ell_i}{\partial f_2}, \quad
\frac{\partial \ell_i}{\partial h_2}, \quad \frac{\partial \ell_i}{\partial f_1}, \quad \frac{\partial \ell_i}{\partial h_1}, \quad\mbox{and} \quad \frac{\partial \ell_i}{\partial f_0}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_i}{\partial f_{3}} = 2(f_3-y_i).
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_i}{\partial h_{3}} =\frac{\partial f_{3}}{\partial h_{3}} \frac{\partial \ell_i}{\partial f_{3}} .
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_i}{\partial f_{2}} &=& \frac{\partial h_{3}}{\partial f_{2}}\left(
\frac{\partial f_{3}}{\partial h_{3}}\frac{\partial \ell_i}{\partial f_{3}} \right)
\nonumber \\
\frac{\partial \ell_i}{\partial h_{2}} &=& \frac{\partial f_{2}}{\partial h_{2}}\left(\frac{\partial h_{3}}{\partial f_{2}}\frac{\partial f_{3}}{\partial h_{3}}\frac{\partial \ell_i}{\partial f_{3}}\right)\nonumber \\
\frac{\partial \ell_i}{\partial f_{1}} &=& \frac{\partial h_{2}}{\partial f_{1}}\left( \frac{\partial f_{2}}{\partial h_{2}}\frac{\partial h_{3}}{\partial f_{2}}\frac{\partial f_{3}}{\partial h_{3}}\frac{\partial \ell_i}{\partial f_{3}} \right)\nonumber \\
\frac{\partial \ell_i}{\partial h_{1}} &=& \frac{\partial f_{1}}{\partial h_{1}}\left(\frac{\partial h_{2}}{\partial f_{1}} \frac{\partial f_{2}}{\partial h_{2}}\frac{\partial h_{3}}{\partial f_{2}}\frac{\partial f_{3}}{\partial h_{3}}\frac{\partial \ell_i}{\partial f_{3}} \right)\nonumber \\
\frac{\partial \ell_i}{\partial f_{0}} &=& \frac{\partial h_{1}}{\partial f_{0}}\left(\frac{\partial f_{1}}{\partial h_{1}}\frac{\partial h_{2}}{\partial f_{1}} \frac{\partial f_{2}}{\partial h_{2}}\frac{\partial h_{3}}{\partial f_{2}}\frac{\partial f_{3}}{\partial h_{3}}\frac{\partial \ell_i}{\partial f_{3}} \right).\label{eq:train2_simple_chain}
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_i}{\partial \beta_{k}} &=& \frac{\partial f_{k}}{\partial \beta_{k}}\frac{\partial \ell_i}{\partial f_{k}}\nonumber \\
\frac{\partial \ell_i}{\partial \omega_{k}} &=& \frac{\partial f_{k}}{\partial \omega_{k}}\frac{\partial \ell_i}{\partial f_{k}}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial f_{k}}{\partial \beta_{k}} = 1 \quad\quad\mbox{and}\quad \quad \frac{\partial f_{k}}{\partial \omega_{k}} &=& h_{k}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial f_{0}}{\partial \beta_{0}} = 1 \quad\quad\mbox{and}\quad \quad \frac{\partial f_{0}}{\partial \omega_{0}} &=& x_{i}.
\end{eqnarray}
\begin{eqnarray}
\mathbf{f}_{0} &=& \boldsymbol\beta_{0} +\boldsymbol\Omega_{0}\mathbf{x}_i\nonumber \\
\mathbf{h}_{1} &=& \mathbf{a}[\mathbf{f}_{0}]\nonumber \\
\mathbf{f}_{1} &=& \boldsymbol\beta_{1} +\boldsymbol\Omega_{1}\mathbf{h}_{1}\nonumber \\
\mathbf{h}_{2} &=& \mathbf{a}[\mathbf{f}_{1}]\nonumber \\
\mathbf{f}_{2} &=& \boldsymbol\beta_{2} +\boldsymbol\Omega_{2}\mathbf{h}_{2}\nonumber \\
\mathbf{h}_{3} &=& \mathbf{a}[\mathbf{f}_{2}]\nonumber \\
\mathbf{f}_{3}&=& \boldsymbol\beta_{3} +\boldsymbol\Omega_{3}\mathbf{h}_{3}\nonumber \\
\ell_{i} &=& \mbox{l}[\mathbf{f}_{3},y_{i}],
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_backward1}
\frac{\partial \ell_{i}}{\partial \mathbf{f}_{2}}=\frac{\partial \mathbf{h}_{3}}{\partial \mathbf{f}_{2}}\frac{\partial \mathbf{f}_3}{\partial \mathbf{h}_{3}} \frac{\partial \ell_{i}}{\partial \mathbf{f}_3}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_backward2}
\frac{\partial \ell_{i}}{\partial \mathbf{f}_{1}}&=& \frac{\partial \mathbf{h}_{2}}{\partial \mathbf{f}_{1}}\frac{\partial \mathbf{f}_{2}}{\partial \mathbf{h}_{2}}
\left(\frac{\partial \mathbf{h}_{3}}{\partial \mathbf{f}_{2}}\frac{\partial \mathbf{f}_3}{\partial \mathbf{h}_{3}} \frac{\partial \ell_{i}}{\partial \mathbf{f}_3}\right) \\
\frac{\partial \ell_{i}}{\partial \mathbf{f}_{0}}&=&\frac{\partial \mathbf{h}_{1}}{\partial \mathbf{f}_{0}}\frac{\partial \mathbf{f}_{1}}{\partial \mathbf{h}_{1}}\left(\frac{\partial \mathbf{h}_{2}}{\partial \mathbf{f}_{1}}\frac{\partial \mathbf{f}_{2}}{\partial \mathbf{h}_{2}}
\frac{\partial \mathbf{h}_{3}}{\partial \mathbf{f}_{2}}\frac{\partial \mathbf{f}_3}{\partial \mathbf{h}_{3}} \frac{\partial \ell_{i}}{\partial \mathbf{f}_3}\right).\label{eq:train2_backward2a}
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \mathbf{f}_3}{\partial \mathbf{h}_{3}} = \frac{\partial}{\partial \mathbf{h}_{3}}\left(\boldsymbol\beta_{3} +\boldsymbol\Omega_{3}\mathbf{h}_{3}\right) = \boldsymbol\Omega_{3}^{T}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_{i}}{\partial \boldsymbol\beta_k} &=& \frac{\partial \mathbf{f}_{k}}{\partial \boldsymbol\beta_k} \frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}} \nonumber\\
&=& \frac{\partial}{\partial \boldsymbol\beta_k}\left(\boldsymbol\beta_{k} +\boldsymbol\Omega_{k}\mathbf{h}_{k}\right) \frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}} \nonumber \\
&=& \frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}},
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_{i}}{\partial \boldsymbol\Omega_k} &=& \frac{\partial \mathbf{f}_{k}}{\partial \boldsymbol\Omega_k} \frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}} \nonumber\\
&=& \frac{\partial}{\partial \boldsymbol\Omega_k}\left(\boldsymbol\beta_{k} +\boldsymbol\Omega_{k}\mathbf{h}_{k}\right) \frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}} \nonumber \\
&=& \frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}}\mathbf{h}_k^{T}.
\end{eqnarray}
\begin{eqnarray}
\mathbf{f}_{0} &=& \boldsymbol\beta_{0} +\boldsymbol\Omega_{0}\mathbf{x}_i\nonumber \\
\mathbf{h}_{k} &=& \mathbf{a}[\mathbf{f}_{k-1}]\hspace{2.76cm} k\in\{1,2,\ldots, K\}\nonumber \\
\mathbf{f}_{k} &=& \boldsymbol\beta_{k} +\boldsymbol\Omega_{k}\mathbf{h}_{k}.\hspace{2cm} k\in\{1,2,\ldots, K\}
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_bp_backward_summary}
\frac{\partial \ell_{i}}{\partial \boldsymbol\beta_k} &=& \frac{\partial \ell_{i}}{\partial \mathbf{f}_k} \hspace{4.1cm} k\in\{K,K-1,\ldots, 1\}\nonumber\\
\frac{\partial \ell_{i}}{\partial \boldsymbol\Omega_k} &=& \frac{\partial \ell_{i}}{\partial \mathbf{f}_k}\mathbf{h}_{k}^{T}\hspace{3.65cm} k\in\{K,K-1,\ldots, 1\}\nonumber\\
\frac{\partial \ell_{i}}{\partial \mathbf{f}_{k-1}} &=& \mathbb{I}[\mathbf{f}_{k-1}>0]\odot \left(\boldsymbol\Omega_{k}^{T}\frac{\partial \ell_{i}}{\partial \mathbf{f}_{k}}\right),\hspace{0.82cm} k\in\{K,K-1,\ldots, 1\}
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell_{i}}{\partial \boldsymbol\beta_0} &=& \frac{\partial \ell_{i}}{\partial \mathbf{f}_0} \nonumber\\
\frac{\partial \ell_{i}}{\partial \boldsymbol\Omega_0} &=& \frac{\partial \ell_{i}}{\partial \mathbf{f}_0}\mathbf{x}_{i}^{T}.
\end{eqnarray}
\begin{eqnarray}
\mathbf{f}_{k} &=& \boldsymbol\beta_{k} +\boldsymbol\Omega_{k}\mathbf{h}_{k}\nonumber\\
&=& \boldsymbol\beta_{k} +\boldsymbol\Omega_{k}\textbf{a}[\mathbf{f}_{k-1}],
\end{eqnarray}
\begin{eqnarray}
\mathbf{h} &=& \mbox{\bf a}[\mathbf{f}],\nonumber \\
\mathbf{f}' &=& \boldsymbol\beta +\boldsymbol\Omega\mathbf{h}
\end{eqnarray}
\begin{eqnarray}
\mathbb{E}[f'_{i}] &=& \mathbb{E}\left[\beta_{i} + \sum_{j=1}^{D_h}\Omega_{ij}h_{j}\right]\nonumber \\
&=& \mathbb{E}\left[\beta_{i}\right] +\sum_{j=1}^{D_h}\mathbb{E}\left[\Omega_{ij}h_{j}\right] \nonumber\\
&=& \mathbb{E}\left[\beta_{i}\right] +\sum_{j=1}^{D_h}\mathbb{E}\left[\Omega_{ij}\right]\mathbb{E}\left[h_{j}\right] \nonumber\\
&=& 0 + \sum_{j=1}^{D_h} 0\cdot\mathbb{E}\left[h_{j}\right] = 0,
\end{eqnarray}
\begin{eqnarray}
\sigma^{2}_{f'_i} &=& \mathbb{E}[f_{i}^{\prime 2}]-\mathbb{E}[f'_{i}]^{2} \nonumber \\
&=& \mathbb{E}\left[\left(\beta_{i}+\sum_{j=1}^{D_h}\Omega_{ij}h_{j}\right)^2\right]-0\nonumber\\
&=& \mathbb{E}\left[\left(\sum_{j=1}^{D_h}\Omega_{ij}h_{j}\right)^2\right]\nonumber\\
&=& \sum_{j=1}^{D_h}\mathbb{E}\left[\Omega_{ij}^2\right]\mathbb{E}\left[h_{j}^2\right]\nonumber \\
&=&\sum_{j=1}^{D_h} \sigma_\Omega^2 \mathbb{E}\left[h_{j}^2\right] = \sigma_\Omega^2 \sum_{j=1}^{D_h} \mathbb{E}\left[h_{j}^2\right],
\end{eqnarray}
\begin{eqnarray}
\sigma^{2}_{f'_{i}} = \sigma_\Omega^2 \sum_{j=1}^{D_h} \frac{\sigma_{f}^2}{2} = \frac{1}{2}D_{h} \sigma_\Omega^2 \sigma_{f}^2.
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_init_forward}
\sigma_\Omega^2 = \frac{2}{D_h},
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_init_back}
\sigma_\Omega^2 = \frac{2}{D_{h'}},
\end{eqnarray}
\begin{eqnarray}
\sigma_\Omega^2 = \frac{4}{D_{h}+D_{h'}}.
\end{eqnarray}
\begin{eqnarray}
y &=& \phi_{0}+\phi_{1}\mbox{a}\Bigl[\psi_{01} + \psi_{11}\mbox{a}[\theta_{01} + \theta_{11}x] + \psi_{21}\mbox{a}[\theta_{02} + \theta_{12}x]\Bigr]\nonumber \\
&&\hspace{0.55cm}+\phi_{2}\mbox{a}\Bigl[\psi_{02} + \psi_{12}\mbox{a}[\theta_{01} + \theta_{11}x] + \psi_{22}\mbox{a}[\theta_{02} + \theta_{12}x]\Bigr],
\end{eqnarray}
\begin{eqnarray}
\ell_i = (y_i-\mbox{f}[\mathbf{x}_i,\boldsymbol\phi])^2.
\end{eqnarray}
\begin{eqnarray}
\ell_{i} = -(1-y_{i})\log\Bigl[1-\mbox{sig}\bigl[\mbox{f}[\mathbf{x}_i,\boldsymbol\phi]\bigr]\Bigr] - y_{i}\log\Bigl[\mbox{sig}\bigl[\mbox{f}[\mathbf{x}_i,\boldsymbol\phi]\bigr]\Bigr],
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_logistic}
\mbox{sig}[z] = \frac{1}{1+\exp[-z]}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \mathbf{z}}{\partial \mathbf{h}} = \boldsymbol\Omega^{T},
\end{eqnarray}
\begin{eqnarray}
\mbox{Heaviside}[z] = \begin{cases} 0 & \quad z <0 \\ 1 & \quad z\geq 0\end{cases},
\end{eqnarray}
\begin{eqnarray}
\mbox{rect}[z] = \begin{cases} 0 & \quad z < 0 \\ 1 & \quad 0 \leq z\leq 1 \\ 0 & \quad z > 1\end{cases}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial \ell}{\partial \boldsymbol\Omega} = \frac{\partial \ell}{\partial \mathbf{f}}\mathbf{h}^{T}.
\end{eqnarray}
\begin{eqnarray}\label{eq:train2_prob_leaky_relu}
\mbox{a}[z] = \mbox{ReLU}[z] = \begin{cases} \alpha \cdot z & \quad z <0 \\ z & \quad z\geq 0\end{cases},
\end{eqnarray}
\begin{eqnarray}\label{eq:prob_comp_graph}\index{reverse-mode differentiation}\index{differentiation!reverse mode}\index{backpropagation!on acyclic graph}
y = \exp\left[\exp[x]+\exp[x]^2\right]+ \sin[\exp[x]+\exp[x]^2].
\end{eqnarray}
\begin{eqnarray}
f_{1} &=& \exp[x]\nonumber \\
f_{2} &=& f_{1}^2\nonumber \\
f_{3} &=& f_{1}+f_{2}\nonumber \\
f_{4} &=& \exp[f_{3}]\nonumber \\
f_{5} &=& \sin[f_{3}]\nonumber \\
y &=& f_{4}+f_{5}.
\end{eqnarray}
\begin{eqnarray}
\frac{\partial y}{\partial f_{5}}, \frac{\partial y}{\partial f_{4}}, \frac{\partial y}{\partial f_{3}},
\frac{\partial y}{\partial f_{2}}, \frac{\partial y}{\partial f_{1}} \mbox{ and } \frac{\partial y}{\partial x},
\end{eqnarray}
\begin{eqnarray}
\frac{\partial f_{1}}{\partial x}, \frac{\partial f_{2}}{\partial x}, \frac{\partial f_{3}}{\partial x}, \frac{\partial f_4}{\partial x},
\frac{\partial f_{5}}{\partial x}, \mbox{ and } \frac{\partial y}{\partial x},
\end{eqnarray}
\begin{eqnarray}
b = \mbox{ReLU}[a] = \begin{cases} 0 & \quad a <0 \\ a& \quad a\geq 0\end{cases},
\end{eqnarray}
\chapter{Measuring performance}
\begin{eqnarray}
\mu[x] = \mathbb{E}_{y}[y[x]] = \int y[x] Pr(y|x) dy,
\end{eqnarray}
\begin{eqnarray}
L[x] &=& \bigl(\mbox{f}[x,\boldsymbol\phi]-y[x]\bigr)^2 \\
&=& \Bigl(\bigl(\mbox{f}[x,\boldsymbol\phi]-\mu[x]\bigr)+\bigl(\mu[x]-y[x]\bigr)\Bigr)^2\nonumber \\
&=& \bigl(\mbox{f}[x,\boldsymbol\phi]-\mu[x]\bigr)^2 + 2\bigl(\mbox{f}[x,\boldsymbol\phi]-\mu[x]\bigr)\bigl(\mu[x]-y[x]\bigr) + \bigl(\mu[x]-y[x]\bigr)^2,\nonumber
\end{eqnarray}
\begin{eqnarray}\label{eq:perf_biasvariance_plus_noise}
\mathbb{E}_{y}\bigl[L[x]\bigr]
&=&\mathbb{E}_{y}\Bigl[\bigl(\mbox{f}[x,\boldsymbol\phi]\!-\!\mu[x]\bigr)^2+2\bigl(\mbox{f}[x,\boldsymbol\phi]\!-\!\mu[x]\bigr)\bigl(\mu[x]\!-\!y[x]\bigr)+\bigl(\mu[x]\!-\!y[x]\bigr)^2\Bigr]\nonumber \\
&=& \bigl(\mbox{f}[x,\boldsymbol\phi]\!-\!\mu[x]\bigr)^2+2\bigl(\mbox{f}[x,\boldsymbol\phi]-\mu[x]\bigr)\bigl(\mu[x]\!-\!\mathbb{E}_y\left[y[x]\right]\bigr)+\mathbb{E}_y\left[(\mu[x]\!-\!y[x])^2\right]\nonumber\\
&=&\bigl(\mbox{f}[x,\boldsymbol\phi]\!-\!\mu[x]\bigr)^2+2\bigl(\mbox{f}[x,\boldsymbol\phi]\!-\!\mu[x]\bigr)\cdot 0 +\mathbb{E}_y\left[\bigl(\mu[x]\!-\!y[x]\bigr)^2\right]\nonumber \\
&=&\bigl(\mbox{f}[x,\boldsymbol\phi]-\mu[x]\bigr)^2+\sigma^{2},
\end{eqnarray}
\begin{eqnarray}
\mbox{f}_{\mu}[x] = \mathbb{E}_{\mathcal{D}}\Bigl[ \mbox{f}\bigl[x,\boldsymbol\phi[\mathcal{D}]\bigr] \Bigr].
\end{eqnarray}
\begin{eqnarray}
\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]\!-\!\mu[x]\bigr)^2 &&\\
&&\hspace{-2.5cm}=\Bigl(\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]\!-\! \mbox{f}_{\mu}[x]\bigr)+\bigl( \mbox{f}_{\mu}[x]-\mu[x]\bigr)\Bigr)^2 \nonumber \\
&&\hspace{-2.5cm}=\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]\!-\! \mbox{f}_{\mu}[x]\bigr)^2+2\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]\!-\! \mbox{f}_{\mu}[x]\bigr)\bigl(\mbox{f}_{\mu}[x]\!-\!\mu[x]\bigr)+\bigl(\mbox{f}_{\mu}[x]\!-\!\mu[x]\bigr)^2.\nonumber
\end{eqnarray}
\begin{eqnarray}\label{eq:perf_bv2}
\mathbb{E}_{\mathcal{D}}\Bigl[\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]-\mu[x]\bigr)^2\Bigr] = \mathbb{E}_\mathcal{D}\Bigl[\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]- \mbox{f}_{\mu}[x]\bigr)^2\Bigr]+\bigl(\mbox{f}_{\mu}[x]-\mu[x]\bigr)^2,
\end{eqnarray}
\begin{eqnarray}\label{eq:perf_bias_variance_final}
\mathbb{E}_{\mathcal{D}}\Bigl[\mathbb{E}_{y}[L[x]]\Bigr] =
\begingroup\color{red}
\underbrace{\color{black}\mystrut{2.0ex}\mathbb{E}_\mathcal{D}\Bigl[\bigl(\mbox{f}[x,\boldsymbol\phi[\mathcal{D}]]- \mbox{f}_{\mu}[x]\bigr)^2\Bigr]}_{\mbox{variance}}
\endgroup
+
\begingroup\color{red}
\underbrace{\color{black}\mystrut{2.0ex}\bigl(\mbox{f}_{\mu}[x]\!-\!\mu[x]\bigr)^2}_{\mbox{bias}}
\endgroup
+
\begingroup\color{red}
\underbrace{\color{black}\mystrut{2.0ex}\sigma^2.}_{\mbox{noise}}
\endgroup
\end{eqnarray}
\begin{eqnarray}
\mbox{Vol}[r] = \frac{r^{D}\pi^{D/2}}{\Gamma[D/2+1]},
\end{eqnarray}
\chapter{Regularization}
\begin{eqnarray}
\hat{\boldsymbol\phi} &=& \mathop{\rm argmin}_{\boldsymbol\phi}\bigl[L[\boldsymbol\phi]\bigr]\nonumber \\
&=& \mathop{\rm argmin}_{\boldsymbol\phi}\left[\sum_{i=1}^{I}\ell_{i}[\mathbf{x}_{i},\mathbf{y}_{i}]\right],
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\left[\sum_{i=1}^{I}\ell_{i}[\mathbf{x}_{i},\mathbf{y}_{i}] + \lambda \cdot \mbox{g}[\boldsymbol\phi]\right],
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmax}_{\boldsymbol\phi}\left[\prod_{i=1}^{I}Pr(\mathbf{y}_{i}|\mathbf{x}_{i},\boldsymbol\phi)\right].
\end{eqnarray}
\begin{eqnarray}
\hat{\boldsymbol\phi} = \mathop{\rm argmax}_{\boldsymbol\phi}\left[\prod_{i=1}^{I}Pr(\mathbf{y}_{i}|\mathbf{x}_{i},\boldsymbol\phi)Pr(\boldsymbol\phi)\right].
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_l2}
\hat{\boldsymbol\phi} = \mathop{\rm argmin}_{\boldsymbol\phi}\left[\sum_{i=1}^{I}\ell_{i}[\mathbf{x}_{i},\mathbf{y}_{i}] + \lambda \sum_{j}\phi_{j}^{2}\right],
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_implicit}
\frac{d\boldsymbol\phi}{dt} = -\frac{\partial L}{\partial\boldsymbol\phi}.
\end{eqnarray}
\begin{eqnarray}
\boldsymbol\phi_{t+1} = \boldsymbol\phi_{t}-\alpha \frac{\partial L[\boldsymbol\phi_{t}]}{\partial\boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_imp_gd}
\tilde{L}_{GD}[\boldsymbol\phi] = L[\boldsymbol\phi] + \frac{\alpha}{4} \left\lVert\frac{\partial L}{\partial \boldsymbol\phi} \right\rVert^{2}.
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_imp_sgd}
\tilde{L}_{SGD}[\boldsymbol\phi] &=& \tilde{L}_{GD}[\boldsymbol\phi]+\frac{\alpha}{4 B}\sum_{b=1}^{B}\left\lVert\frac{\partial L_{b}}{\partial \boldsymbol\phi} - \frac{\partial L}{\partial \boldsymbol\phi} \right\rVert^{2}\nonumber \\
&=& L[\boldsymbol\phi] + \frac{\alpha}{4} \left\lVert\frac{\partial L}{\partial \boldsymbol\phi} \right\rVert^{2}+\frac{\alpha}{4 B}\sum_{b=1}^{B}\left\lVert\frac{\partial L_{b}}{\partial \boldsymbol\phi} - \frac{\partial L}{\partial \boldsymbol\phi} \right\rVert^{2}.
\end{eqnarray}
\begin{eqnarray}
L = \frac{1}{I} \sum_{i=1}^{I}\ell_{i}[\mathbf{x}_{i},y_{i}] \quad \quad \mbox{and}\quad\quad L_{b} = \frac{1}{|\mathcal{B}|} \sum_{i\in \mathcal{B}_{b}}\ell_{i}[\mathbf{x}_{i},y_{i}].
\end{eqnarray}
\begin{eqnarray}
Pr(\boldsymbol\phi|\{\mathbf{x}_{i},\mathbf{y}_{i}\}) = \frac{\prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mathbf{x}_{i},\boldsymbol\phi) Pr(\boldsymbol\phi)}{\int \prod_{i=1}^{I} Pr(\mathbf{y}_{i}|\mathbf{x}_{i},\boldsymbol\phi) Pr(\boldsymbol\phi)d\boldsymbol\phi } ,
\end{eqnarray}
\begin{eqnarray}
Pr(\mathbf{y}|\mathbf{x}, \{\mathbf{x}_{i},\mathbf{y}_{i}\}) = \int Pr(\mathbf{y}|\mathbf{x},\boldsymbol\phi) Pr(\boldsymbol\phi |\{\mathbf{x}_{i},\mathbf{y}_{i}\}) d\boldsymbol\phi.
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_weight_decay}
\boldsymbol\phi \longleftarrow (1-\lambda') \boldsymbol\phi - \alpha \frac{\partial L}{\partial \boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_imp_discrete}
\boldsymbol\phi_{1} = \boldsymbol\phi_{0} + \alpha \cdot\mbox{\bf g}[\boldsymbol\phi_0],
\end{eqnarray}
\begin{eqnarray}
\frac{d\boldsymbol\phi}{dt} =\mbox{\bf g}[\boldsymbol\phi].
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_imp_correction}
\frac{d\boldsymbol\phi}{dt} \approx \mbox{\bf g}[\boldsymbol\phi] +\alpha \mbox{\bf g}_{1}[\boldsymbol\phi] + \ldots,
\end{eqnarray}
\begin{eqnarray}
\boldsymbol\phi[\alpha] &\approx& \left.\boldsymbol\phi + \alpha \frac{d\boldsymbol\phi}{dt} + \frac{\alpha^2}{2}\frac{d^2\boldsymbol\phi }{dt^2}\right|_{\boldsymbol\phi=\boldsymbol\phi_{0}}\nonumber \\
&\approx& \left.\boldsymbol\phi + \alpha \left(\mbox{\bf g}[\boldsymbol\phi] +\alpha \mbox{\bf g}_{1}[\boldsymbol\phi] \right) + \frac{\alpha^2}{2}\left(\frac{\partial \mbox{\bf g}[\boldsymbol\phi]}{\partial \boldsymbol\phi}\frac{d\boldsymbol\phi}{dt} +\alpha \frac{\partial \mbox{\bf g}_{1}[\boldsymbol\phi]}{\partial \boldsymbol\phi}\frac{d\boldsymbol\phi}{dt}\right)\right|_{\boldsymbol\phi=\boldsymbol\phi_{0}}\nonumber \\
&=& \left.\boldsymbol\phi + \alpha \left(\mbox{\bf g}[\boldsymbol\phi] +\alpha \mbox{\bf g}_{1}[\boldsymbol\phi]\right) + \frac{\alpha^2}{2}\left(\frac{\partial \mbox{\bf g}[\boldsymbol\phi]}{\partial \boldsymbol\phi}\mbox{\bf g}[\boldsymbol\phi] +\alpha \frac{\partial \mbox{\bf g}_{1}[\boldsymbol\phi]}{\partial \boldsymbol\phi}\mbox{\bf g}[\boldsymbol\phi]\right)\right|_{\boldsymbol\phi=\boldsymbol\phi_{0}}\nonumber \\
&\approx& \left.\boldsymbol\phi + \alpha \mbox{\bf g}[\boldsymbol\phi] + \alpha^2\left(\mbox{\bf g}_{1}[\boldsymbol\phi] +\frac{1}{2}\frac{\partial \mbox{\bf g}[\boldsymbol\phi]}{\partial \boldsymbol\phi}\mbox{\bf g}[\boldsymbol\phi]\right)\right|_{\boldsymbol\phi=\boldsymbol\phi_{0}},
\end{eqnarray}
\begin{eqnarray}
\mbox{\bf g}_{1}[\boldsymbol\phi] = -\frac{1}{2}\frac{\partial \mbox{\bf g}[\boldsymbol\phi]}{\partial \boldsymbol\phi}\mbox{\bf g}[\boldsymbol\phi].
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_imp_proof1}
\frac{d\boldsymbol\phi}{dt} &\approx& \mbox{\bf g}[\boldsymbol\phi] +\alpha \mbox{\bf g}_{1}[\boldsymbol\phi] \nonumber \\
&=& -\frac{\partial L}{\partial \boldsymbol\phi}-\frac{\alpha}{2}\left(\frac{\partial^2 L}{\partial \boldsymbol\phi^2}\right)\frac{\partial L}{\partial \boldsymbol\phi}.
\end{eqnarray}
\begin{eqnarray}\label{eq:reg_imp_proof2}
L_{GD}[\boldsymbol\phi] = L[\boldsymbol\phi] + \frac{\alpha}{4} \left\lVert\frac{\partial L}{\partial \boldsymbol\phi} \right\rVert^{2},
\end{eqnarray}
\begin{eqnarray}
Pr(\boldsymbol\phi) = \prod_{j=1}^{J}\mbox{Norm}_{\phi_j}[0, \sigma^{2}_{\boldsymbol\phi}],
\end{eqnarray}
\begin{eqnarray}
\boldsymbol\phi \longleftarrow (1-\lambda) \boldsymbol\phi - \alpha \frac{\partial L}{\partial \boldsymbol\phi},
\end{eqnarray}
\begin{eqnarray}
\tilde{L}[\boldsymbol\phi] = L[\boldsymbol\phi] + \frac{\lambda}{2\alpha} \sum_{k}\phi_{k}^2,
\end{eqnarray}
\chapter{Convolutional networks}
\begin{eqnarray}
\mbox{\bf f}\bigl[\mbox{\bf t}[\mathbf{x}]\bigr] = \mbox{\bf f}[\mathbf{x}].
\end{eqnarray}
\begin{eqnarray}
\mbox{\bf f}\bigl[\mbox{\bf t}[\mathbf{x}]\bigr] = \mbox{\bf t}\bigl[\mbox{\bf f}[\mathbf{x}]\bigr].
\end{eqnarray}
\begin{eqnarray}\label{eq:conv_kernel_3a}
z_{i} = \omega_{1}x_{i-1}+\omega_{2}x_{i} + \omega_{3}x_{i+1},
\end{eqnarray}
\begin{eqnarray}\label{eq:conv_kernel_3}
h_{i} &=& \mbox{a}\left[\beta + \omega_{1}x_{i-1}+\omega_{2}x_{i} + \omega_{3}x_{i+1}\right]\nonumber\\
&=& \mbox{a}\left[\beta + \sum_{j=1}^{3} \omega_{j} x_{i+j-2}\right],
\end{eqnarray}
\begin{eqnarray}\label{eq:conv_fully}
h_{i} &=& \mbox{a}\left[\beta_{i} + \sum_{j=1}^{D} \omega_{ij} x_{j}\right].
\end{eqnarray}
\begin{eqnarray}\label{eq:conv_kernel_2d}
h_{ij} &=& \mbox{a}\left[\beta + \sum_{m=1}^{3}\sum_{n=1}^{3} \omega_{mn} x_{i+m-2,j+n-2}\right],
\end{eqnarray}
\chapter{Residual networks}
\begin{eqnarray}\label{eq:residual_sequential}
\mbox{\bf h}_1 &=& \mbox{\bf f}_{1}[\mathbf{x},
\boldsymbol\phi_{1}]\nonumber \\
\mbox{\bf h}_2 &=& \mbox{\bf f}_{2}[\mathbf{h}_{1},\boldsymbol\phi_{2}]\nonumber \\
\mbox{\bf h}_3 &=& \mbox{\bf f}_{3}[\mathbf{h}_{2},\boldsymbol\phi_{3}]\nonumber \\
\mathbf{y} &=& \mbox{\bf f}_{4}[\mathbf{h}_{3},\boldsymbol\phi_{4}],
\end{eqnarray}
\begin{eqnarray}
\mathbf{y}= \mbox{\bf f}_{4}\biggl[\mbox{\bf f}_{3}\Bigl[\mbox{\bf f}_{2}\bigl[\mbox{\bf f}_{1}[\mathbf{x},\boldsymbol\phi_{1}],\boldsymbol\phi_{2}\bigr],\boldsymbol\phi_{3}\Bigr],\boldsymbol\phi_{4}\biggr].
\end{eqnarray}
\begin{eqnarray}\label{eq:residual_chain}
\frac{\partial \mathbf{y}}{\partial \mathbf{f}_1} = \frac{\partial \mathbf{f}_{2}}{\partial \mathbf{f}_{1}}\frac{\partial \mathbf{f}_{3}}{\partial \mathbf{f}_{2}}\frac{\partial \mathbf{f}_{4}}{\partial \mathbf{f}_{3}}.
\end{eqnarray}
\begin{eqnarray}\label{eq:residual_example}
\mathbf{h}_{1} &=& \mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x},\boldsymbol\phi_{1}]\nonumber \\
\mathbf{h}_{2} &=& \mathbf{h}_{1} + \mbox{\bf f}_{2}[\mathbf{h}_{1},\boldsymbol\phi_{2}]\nonumber \\
\mathbf{h}_3 &=& \mathbf{h}_{2} + \mbox{\bf f}_{3}[\mathbf{h}_{2},\boldsymbol\phi_{3}]\nonumber \\
\mathbf{y} &=& \mathbf{h}_{3} + \mbox{\bf f}_{4}[\mathbf{h}_{3}, \boldsymbol\phi_{4}],
\end{eqnarray}
\begin{eqnarray}\label{eq:residual_substitute}
&\mathbf{y} = \mathbf{x} &\hspace{-2mm}+\hspace{2mm} \mbox{\bf f}_{1}[\mathbf{x}] \\
&&\hspace{-2mm}+\hspace{2mm} \mbox{\bf f}_{2}\bigl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}]\bigr] \nonumber \\
&&\hspace{-2mm}+\hspace{2mm} \mbox{\bf f}_{3}\Bigl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}] + \mbox{\bf f}_{2}\bigl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}]\bigr]\Bigr]\nonumber\\
&&\hspace{-2mm}+\hspace{2mm}\mbox{\bf f}_{4}\biggl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}] + \mbox{\bf f}_{2}\bigl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}]\bigr]+ \mbox{\bf f}_{3}\Bigl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}] + \mbox{\bf f}_{2}\bigl[\mathbf{x} + \mbox{\bf f}_{1}[\mathbf{x}]\bigr]\Bigr]\biggr],\nonumber
\end{eqnarray}
\begin{eqnarray}\label{eq:residual_deriv}
\frac{\partial \mathbf{y}}{\partial \mbox{\bf f}_{1}} = \mathbf{I} + \frac{\partial \mathbf{f}_{2}}{\partial \mathbf{f}_1} + \left(\frac{\partial \mathbf{f}_{3}}{\partial \mathbf{f}_1}+ \frac{\partial \mathbf{f}_{2}}{\partial \mathbf{f}_1}\frac{\partial \mathbf{f}_{3}}{\partial \mathbf{f}_2} \right)
+ \left(\frac{\partial \mathbf{f}_{4}}{\partial \mathbf{f}_1}
+ \frac{\partial \mathbf{f}_{2}}{\partial \mathbf{f}_1}\frac{\partial \mathbf{f}_{4}}{\partial \mathbf{f}_2}
+ \frac{\partial \mathbf{f}_{3}}{\partial \mathbf{f}_1}\frac{\partial \mathbf{f}_{4}}{\partial \mathbf{f}_3}
+ \frac{\partial \mathbf{f}_{2}}{\partial \mathbf{f}_1}\frac{\partial \mathbf{f}_{3}}{\partial \mathbf{f}_2}\frac{\partial \mathbf{f}_{4}}{\partial \mathbf{f}_3}\right),
\end{eqnarray}
\begin{eqnarray}
m_{h} &=& \frac{1}{|\mathcal{B}|} \sum_{i\in\mathcal{B}} h_{i}\nonumber \\
s_{h} &=& \sqrt{\frac{1}{|\mathcal{B}|} \sum_{i\in\mathcal{B}} (h_{i}-m_{h})^2},
\end{eqnarray}
\begin{eqnarray}\label{eq:residual_bn_apply}
h_i \leftarrow \frac{h_i-m_{h}}{s_{h}+\epsilon}\hspace{2cm}\forall i\in\mathcal{B},
\end{eqnarray}
\begin{eqnarray}
h_i \leftarrow \gamma h_i + \delta\hspace{2cm}\forall i\in\mathcal{B}.
\end{eqnarray}
\begin{eqnarray}\label{eq:residual_prob_forward}
\begin{split}
f_{1} &= \mathbb{E}[z_{i}]\\
f_{2i} &= z_{i} - f_{1}\\
f_{3i} &= f_{2i}^2\\
f_{4} &= \mathbb{E}[f_{3i}] \\
\end{split}
\qquad\qquad\qquad
\begin{split}
f_{5} &= \sqrt{f_{4}+\epsilon} \\
f_{6} &= 1/f_{5}\\
f_{7i} &= f_{2i}\times f_{6} \\
z_{i}' &= f_{7i} \times \gamma + \delta,
\end{split}
\end{eqnarray}
\chapter{Transformers}