proto.lib

Loss Spike và Gradient Clipping

Một batch xấu hoặc một bước cập nhật không may có thể tạo gradient rất lớn phá hỏng trọng số; norm của gradient được clip trước khi optimizer step, đồng thời run giám sát NaN/Inf do tràn số ở độ chính xác thấp để có thể skip batch hoặc rollback về checkpoint trước với learning rate giảm.

AI/ML SystemsTrung bình2026-08-24
Loss Spike và Gradient Clipping

Mở rộng

Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc

Liên quan