PaperScope
LIVE · 2026-10-06 05:40 UTC

Arithmetic Actor Heads and Training Stabilization for Out-of-Distribution Reinforcement Learning

Yifan Zhang, Liang Zheng

Latestcs.CLcs.LGcs.AIcs.CV
arXiv ID
2610.05143 v1
Category
Submitted
2026-10-04

Abstract

Reinforcement learning (RL) policies can deteriorate under out-of-distribution (OOD) magnitude shifts. Starting from soft actor-critic (SAC) and its Bayesian Amnesic Piecewise-Robust (BAPR) predecessor, we study the causal-symbolic BAPR (CS-BAPR) family. The practical method combines six training-stabilization settings with alternative actor heads: a Neural Addition Unit (NAU) with a Neural Multiplication Unit (NMU)-inspired quadratic correction, a Kolmogorov-Arnold Network (KAN), or a multilayer perceptron (MLP) with rectified linear unit (ReLU) or hyperbolic-tangent activations.

arXiv abs page · PDF · same-day batch