Skip to main content

Overview

Neurenix provides implementations of state-of-the-art reinforcement learning algorithms for both discrete and continuous action spaces.

DQN - Deep Q-Network

Parameters

Dict[str, Any]
required
Observation space specification.
Dict[str, Any]
required
Action space specification.
List[int]
default:"[64, 64]"
Hidden layer dimensions for the Q-network.
float
default:"0.001"
Learning rate for optimizer.
float
default:"0.99"
Discount factor for future rewards.
float
default:"1.0"
Initial exploration rate.
float
default:"0.01"
Final exploration rate.
float
default:"0.995"
Exploration rate decay per episode.
int
default:"10000"
Experience replay buffer size.
int
default:"64"
Batch size for training.
int
default:"100"
Number of steps between target network updates.
bool
default:"False"
Whether to use Double DQN.
bool
default:"False"
Whether to use Dueling DQN architecture.

Methods

train

Train the DQN agent on an environment.
Dict[str, List[float]]
Dictionary of training metrics including episode rewards and losses.

A2C - Advantage Actor-Critic

Parameters

Dict[str, Any]
required
Observation space specification.
Dict[str, Any]
required
Action space specification.
List[int]
default:"[64, 64]"
Actor network hidden layer dimensions.
List[int]
default:"[64, 64]"
Critic network hidden layer dimensions.
float
default:"0.0003"
Actor learning rate.
float
default:"0.001"
Critic learning rate.
float
default:"0.99"
Discount factor.
float
default:"0.01"
Entropy loss coefficient for exploration.
float
default:"0.5"
Value loss coefficient.
float
default:"0.5"
Maximum gradient norm for clipping.

PPO - Proximal Policy Optimization

PPO is one of the most popular RL algorithms, offering stable and efficient training.

DDPG - Deep Deterministic Policy Gradient

DDPG is designed for continuous action spaces.

SAC - Soft Actor-Critic

SAC is an off-policy algorithm for continuous control with entropy regularization.

Example Usage

Algorithm Comparison

Tips

Hyperparameter tuning: Start with default hyperparameters and adjust based on your environment. Learning rate and discount factor (gamma) are often the most important.
Buffer size: Larger buffers improve sample efficiency but require more memory. Use 10K-100K for simple tasks, 1M+ for complex tasks.
Network architecture: Deeper networks (3-4 layers) work better for visual inputs, while 2-layer networks suffice for low-dimensional states.