{
  "schema_version": 1,
  "snapshot_at": "2026-09-15T01:19:08.614705+00:00",
  "title": "Qwen3-14B DEX trainer comparison, September 14, 2026 snapshot",
  "protocol": {
    "model": "Qwen/Qwen3-14B",
    "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
    "hardware": "One NVIDIA RTX PRO 6000 Blackwell 96 GB per run",
    "precision": "NF4 weights, BF16 compute",
    "lora_rank": 32,
    "lora_alpha": 64,
    "seed": 42,
    "optimizer_steps": 50,
    "group_size": 4,
    "fresh_batch_completions": 8,
    "updates_per_rollout": 2,
    "learning_rate": 1e-05,
    "reward_weights": {
      "native": 1,
      "efficiency": 0.05,
      "reliability": 0.2
    },
    "holdout": "5 trained families x 2 held-out task seeds x 4 samples = 40 episodes, 10 distinct tasks",
    "checkpoint_selection": "Final checkpoint, fixed training budget; no holdout-based checkpoint selection"
  },
  "caveats": [
    "One training seed per configuration; no statistical winner established.",
    "Thinking uses a 2048 thinking-token cap and 3072 total tokens per turn; no-think uses 1024 total tokens per turn. These are budget configurations, not equal-token comparisons.",
    "Fresh reward is logged only on odd optimizer steps. Even steps reuse the preceding rollout.",
    "Reward is the logged composite rollout score, not native holdout reward or financial profit.",
    "Refill steps average reward logs across generation rounds. Saved completion rows cover the last generated round, not the final merged optimizer batch.",
    "Step hours sum optimizer-step timers including rollout generation; exclude provisioning, installation, model loading, holdout and uploads. They are not billed VM hours.",
    "Memory values are recorded training CUDA allocated/reserved peaks. Historical no-think runs lack these fields.",
    "The hybrid refill run is partial at the snapshot cutoff; no holdout exists in this snapshot.",
    "Held-out instances are synthetic and within trained families; these measurements do not establish live trading performance."
  ],
  "runs": [
    {
      "run_id": "1789188652",
      "mode": "no-think",
      "method": "initial",
      "steps": 0,
      "reward_points": 0,
      "train_mean": null,
      "train_last10": null,
      "holdout_native": 0.38555043464607947,
      "holdout_episodes": 40,
      "holdout_successes": 16,
      "mean_step_seconds": null,
      "label": "Starting model",
      "state_at_cutoff": "complete",
      "step_hours": null,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0,
      "groups_refilled": 0,
      "holdout_component_means": {
        "native": 0.38555043464607947,
        "efficiency": 0.1625,
        "reliability": -0.15
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "entropy_holdout_episodes.jsonl": "61b34dafee4b443d1f7a1966e06e93ec722ac1f8f030714c7ae4f0573804c00f",
        "resolved_training_config.json": "7447b43fa5ec879c6d319e7548b69d5ec8f4680d73d125e4cbd0a260e4551ca9"
      },
      "training_steps": [],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.615643296169515,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 290,
          "reward_channels": {
            "native": 0.615643296169515,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6156419091142415,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 317,
          "reward_channels": {
            "native": 0.6156419091142415,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6156430169577571,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 251,
          "reward_channels": {
            "native": 0.6156430169577571,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 550,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6154821465692866,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 519,
          "reward_channels": {
            "native": 0.6154821465692866,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 546,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 389,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 362,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.5848008209671872,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 606,
          "reward_channels": {
            "native": 0.5848008209671872,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 736,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 483,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 684,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 514,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 760,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6192995951616761,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 696,
          "reward_channels": {
            "native": 0.6192995951616761,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 656,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 694,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6212167624035315,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 406,
          "reward_channels": {
            "native": 0.6212167624035315,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6161298837365798,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 387,
          "reward_channels": {
            "native": 0.6161298837365798,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6161282892735525,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 366,
          "reward_channels": {
            "native": 0.6161282892735525,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6179612389087088,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 332,
          "reward_channels": {
            "native": 0.6179612389087088,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6153297728643924,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 569,
          "reward_channels": {
            "native": 0.6153297728643924,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 575,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6163578745967674,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 391,
          "reward_channels": {
            "native": 0.6163578745967674,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 514,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6140284978433885,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 301,
          "reward_channels": {
            "native": 0.6140284978433885,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 756,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8308833579638738,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 320,
          "reward_channels": {
            "native": 0.8308833579638738,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 724,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 737,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8287354292640952,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 369,
          "reward_channels": {
            "native": 0.8287354292640952,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 821,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8287354940486263,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 263,
          "reward_channels": {
            "native": 0.8287354940486263,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 464,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789151457",
      "mode": "no-think",
      "method": "grpo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.703773136138916,
      "train_last10": 0.7729044497013092,
      "holdout_native": 0.6423985158115345,
      "holdout_episodes": 40,
      "holdout_successes": 38,
      "mean_step_seconds": 177.08361022171974,
      "label": "GRPO",
      "state_at_cutoff": "complete",
      "step_hours": 2.459494586412774,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.6423985158115345,
        "efficiency": 0.4708333333333334,
        "reliability": 0.9
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "grpo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "grpo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "bd297cd2a864b080aec383fe534465a878ce0d7795e76bb5e1ad6846445367ab",
        "entropy_holdout_episodes.jsonl": "4546dfd4faba49ca69699ded44a29683c3e2ca5161182a3fc6567061ba47594b",
        "resolved_training_config.json": "a6a46f534eb34e2b299247249bfc4f357b28e6f9d2eb502e18be9539e6ab1c8a"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -1.1175870895385742e-08,
          "grad_norm": 0.2431640625,
          "learning_rate": 1e-05,
          "num_tokens": 27996.0,
          "completions/mean_length": 603.0,
          "completions/min_length": 278.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 603.0,
          "completions/min_terminated_length": 278.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5008535981178284,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.21723572909832,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.3369031250476837,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3238062560558319,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.4792949855327606,
          "reward_std": 0.45436012744903564,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04867766337702051,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 352.69348045599986,
          "entropy_control/entropy": 0.03031625726079178,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 249.134806,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 269.704387,
          "forward_backward_time": 82.877189,
          "rollout_overhead_time": 20.569581
        },
        {
          "step": 2,
          "loss": -0.0008399337530136108,
          "grad_norm": 0.2060546875,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.048708565649576485,
          "clip_ratio/low_mean": 0.0005130928620928898,
          "clip_ratio/low_min": 0.0005130928620928898,
          "clip_ratio/high_mean": 0.002514466643333435,
          "clip_ratio/high_max": 0.002514466643333435,
          "clip_ratio/region_mean": 0.003027559505426325,
          "step_time": 82.91500510800006,
          "entropy_control/entropy": 0.03025453078373544,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.799137,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": -7.399643072858453e-05,
          "grad_norm": 0.15625,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 52569.0,
          "completions/mean_length": 355.625,
          "completions/min_length": 299.0,
          "completions/max_length": 526.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 355.625,
          "completions/min_terminated_length": 299.0,
          "completions/max_terminated_length": 526.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5030288696289062,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2024640142917633,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.2708333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.12400397658348083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.6665704846382141,
          "reward_std": 0.3200153410434723,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07991488021798432,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 258.22600335200013,
          "entropy_control/entropy": 0.07515834817317896,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 166.98614,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 184.568514,
          "forward_backward_time": 73.54299,
          "rollout_overhead_time": 17.582374
        },
        {
          "step": 4,
          "loss": -0.0005477418890222907,
          "grad_norm": 0.0888671875,
          "learning_rate": 9.4e-06,
          "entropy": 0.0792204940225929,
          "clip_ratio/low_mean": 0.001218765857629478,
          "clip_ratio/low_min": 0.001218765857629478,
          "clip_ratio/high_mean": 0.002375894458964467,
          "clip_ratio/high_max": 0.002375894458964467,
          "clip_ratio/region_mean": 0.003594660316593945,
          "step_time": 73.627856651,
          "entropy_control/entropy": 0.07454071336359021,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.520765,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": 4.470348358154297e-07,
          "grad_norm": 0.224609375,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 77055.0,
          "completions/mean_length": 351.75,
          "completions/min_length": 288.0,
          "completions/max_length": 521.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 351.75,
          "completions/min_terminated_length": 288.0,
          "completions/max_terminated_length": 521.0,
          "tools/call_frequency": 4.75,
          "tools/failure_frequency": 0.1315789520740509,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5532469749450684,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15319469571113586,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1178511381149292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.717830240726471,
          "reward_std": 0.3003321588039398,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06839368864893913,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 292.5127315850002,
          "entropy_control/entropy": 0.06708223354780454,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 200.99866,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 218.492077,
          "forward_backward_time": 73.912911,
          "rollout_overhead_time": 17.493417
        },
        {
          "step": 6,
          "loss": -0.0005029439926147461,
          "grad_norm": 0.236328125,
          "learning_rate": 9e-06,
          "entropy": 0.06814951589331031,
          "clip_ratio/low_mean": 0.0007854699215386063,
          "clip_ratio/low_min": 0.0007854699215386063,
          "clip_ratio/high_mean": 0.00350716634420678,
          "clip_ratio/high_max": 0.00350716634420678,
          "clip_ratio/region_mean": 0.0042926362657453865,
          "step_time": 74.01661177599931,
          "entropy_control/entropy": 0.06685699916611106,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.911966,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.06248396262526512,
          "grad_norm": 0.162109375,
          "learning_rate": 8.8e-06,
          "num_tokens": 109119.0,
          "completions/mean_length": 536.5,
          "completions/min_length": 246.0,
          "completions/max_length": 1023.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 472.2857360839844,
          "completions/min_terminated_length": 246.0,
          "completions/max_terminated_length": 1023.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3410455584526062,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1820911467075348,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6818172931671143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28787821531295776,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.51976478099823,
          "reward_std": 0.5069523453712463,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02533304301323369,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 337.1979487909998,
          "entropy_control/entropy": 0.02212925314251013,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 218.429661,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 240.530696,
          "forward_backward_time": 96.561975,
          "rollout_overhead_time": 22.101035
        },
        {
          "step": 8,
          "loss": -0.06261745095252991,
          "grad_norm": 0.09326171875,
          "learning_rate": 8.6e-06,
          "entropy": 0.025826407712884247,
          "clip_ratio/low_mean": 0.0008170681248884648,
          "clip_ratio/low_min": 0.0008170681248884648,
          "clip_ratio/high_mean": 0.0014168911147862673,
          "clip_ratio/high_max": 0.0014168911147862673,
          "clip_ratio/region_mean": 0.002233959239674732,
          "step_time": 96.67439458799981,
          "entropy_control/entropy": 0.022419002595210895,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 96.568858,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": -1.4901161193847656e-08,
          "grad_norm": 0.1572265625,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 137769.0,
          "completions/mean_length": 293.25,
          "completions/min_length": 254.0,
          "completions/max_length": 398.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 293.25,
          "completions/min_terminated_length": 254.0,
          "completions/max_terminated_length": 398.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.13333334028720856,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6143291592597961,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0010098718339577317,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4425812363624573,
          "reward_std": 0.4197315573692322,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06191796762868762,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 246.38061882300053,
          "entropy_control/entropy": 0.0668467061896424,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 133.529362,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 154.472101,
          "forward_backward_time": 91.798267,
          "rollout_overhead_time": 20.94274
        },
        {
          "step": 10,
          "loss": -0.00017190352082252502,
          "grad_norm": 0.1318359375,
          "learning_rate": 8.2e-06,
          "entropy": 0.061034107115119696,
          "clip_ratio/low_mean": 0.0008351178839802742,
          "clip_ratio/low_min": 0.0008351178839802742,
          "clip_ratio/high_mean": 0.0009422110742889345,
          "clip_ratio/high_max": 0.0009422110742889345,
          "clip_ratio/region_mean": 0.0017773289582692087,
          "step_time": 91.90123079600062,
          "entropy_control/entropy": 0.06596986373564874,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.791034,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": 2.4065375328063965e-06,
          "grad_norm": 0.33984375,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 166825.0,
          "completions/mean_length": 319.0,
          "completions/min_length": 264.0,
          "completions/max_length": 409.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 319.0,
          "completions/min_terminated_length": 264.0,
          "completions/max_terminated_length": 409.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6147550344467163,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0012653579469770193,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.09622503817081451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6125867366790771,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.001267216051928699,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622503817081451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8345041275024414,
          "reward_std": 0.005744827911257744,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06843931006733328,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 235.28879666799958,
          "entropy_control/entropy": 0.07227286487301786,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 137.09465,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 155.86287,
          "forward_backward_time": 79.322734,
          "rollout_overhead_time": 18.768221
        },
        {
          "step": 12,
          "loss": 0.0006765499711036682,
          "grad_norm": 0.482421875,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.0681472544092685,
          "clip_ratio/low_mean": 0.0004734848625957966,
          "clip_ratio/low_min": 0.0004734848625957966,
          "clip_ratio/high_mean": 0.0015520643792115152,
          "clip_ratio/high_max": 0.0015520643792115152,
          "clip_ratio/region_mean": 0.0020255492418073118,
          "step_time": 79.40832818699982,
          "entropy_control/entropy": 0.07203012919287269,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.305767,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": 7.3577044531703e-05,
          "grad_norm": 0.15234375,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 195955.0,
          "completions/mean_length": 352.25,
          "completions/min_length": 252.0,
          "completions/max_length": 722.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 352.25,
          "completions/min_terminated_length": 252.0,
          "completions/max_terminated_length": 722.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.09375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6102476119995117,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.2516975402832031e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3416963219642639,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18339261412620544,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5374302864074707,
          "reward_std": 0.40366190671920776,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04598454339429736,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 308.6096049810003,
          "entropy_control/entropy": 0.04070698001055162,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 194.807216,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 215.960182,
          "forward_backward_time": 92.546204,
          "rollout_overhead_time": 21.152966
        },
        {
          "step": 14,
          "loss": 0.00019895355217158794,
          "grad_norm": 0.14453125,
          "learning_rate": 7.4e-06,
          "entropy": 0.04630886914674193,
          "clip_ratio/low_mean": 0.00017313018906861544,
          "clip_ratio/low_min": 0.00017313018906861544,
          "clip_ratio/high_mean": 0.0005924170836806297,
          "clip_ratio/high_max": 0.0005924170836806297,
          "clip_ratio/region_mean": 0.0007655472727492452,
          "step_time": 92.64190135599938,
          "entropy_control/entropy": 0.041020644994067545,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 92.532393,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": -2.2351741790771484e-08,
          "grad_norm": 0.26953125,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 226261.0,
          "completions/mean_length": 300.75,
          "completions/min_length": 252.0,
          "completions/max_length": 430.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 300.75,
          "completions/min_terminated_length": 252.0,
          "completions/max_terminated_length": 430.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5386062860488892,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3332538306713104,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.29846981167793274,
          "reward_std": 0.4600767195224762,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02504690084606409,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 210.34915412499868,
          "entropy_control/entropy": 0.02372330784831911,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 111.033873,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 129.705962,
          "forward_backward_time": 80.52408,
          "rollout_overhead_time": 18.672089
        },
        {
          "step": 16,
          "loss": 0.00030812621116638184,
          "grad_norm": 0.19921875,
          "learning_rate": 7e-06,
          "entropy": 0.025833570398390293,
          "clip_ratio/low_mean": 0.0002906976733356714,
          "clip_ratio/low_min": 0.0002906976733356714,
          "clip_ratio/high_mean": 0.0004716981202363968,
          "clip_ratio/high_max": 0.0004716981202363968,
          "clip_ratio/region_mean": 0.0007623957935720682,
          "step_time": 80.62655930799974,
          "entropy_control/entropy": 0.02445330641371228,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.516377,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": 7.450580596923828e-08,
          "grad_norm": 0.03173828125,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 259877.0,
          "completions/mean_length": 507.0,
          "completions/min_length": 317.0,
          "completions/max_length": 974.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 507.0,
          "completions/min_terminated_length": 317.0,
          "completions/max_terminated_length": 974.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5229074358940125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1819382905960083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6089195609092712,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7304967641830444,
          "reward_std": 0.27497315406799316,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.01884047588100657,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 301.0209074270001,
          "entropy_control/entropy": 0.016145197240740677,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 196.888417,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 216.662419,
          "forward_backward_time": 84.253635,
          "rollout_overhead_time": 19.774001
        },
        {
          "step": 18,
          "loss": -0.00015524029731750488,
          "grad_norm": 0.0260009765625,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.01891381130553782,
          "clip_ratio/low_mean": 0.00012833676009904593,
          "clip_ratio/low_min": 0.00012833676009904593,
          "clip_ratio/high_mean": 0.00021739130897913128,
          "clip_ratio/high_max": 0.00021739130897913128,
          "clip_ratio/region_mean": 0.0003457280690781772,
          "step_time": 84.37778744900015,
          "entropy_control/entropy": 0.01608851904818625,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 84.264873,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": -0.0001468014670535922,
          "grad_norm": 0.0035552978515625,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 285422.0,
          "completions/mean_length": 298.625,
          "completions/min_length": 259.0,
          "completions/max_length": 399.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 298.625,
          "completions/min_terminated_length": 259.0,
          "completions/max_terminated_length": 399.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6152946352958679,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.5055335325087071e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8315019607543945,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.088771000468114e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9400649666786194,
          "reward_std": 0.11556772887706757,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.061668465728871524,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 221.8670776459976,
          "entropy_control/entropy": 0.06537337239155366,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 118.79643,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 138.001979,
          "forward_backward_time": 83.748845,
          "rollout_overhead_time": 19.205548
        },
        {
          "step": 20,
          "loss": -0.00013157277135178447,
          "grad_norm": 0.00445556640625,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.06107214139774442,
          "clip_ratio/low_mean": 0.0013392106629908085,
          "clip_ratio/low_min": 0.0013392106629908085,
          "clip_ratio/high_mean": 0.0004006410308647901,
          "clip_ratio/high_max": 0.0004006410308647901,
          "clip_ratio/region_mean": 0.0017398516938555986,
          "step_time": 83.84809216400117,
          "entropy_control/entropy": 0.06471683871963352,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.74383,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": -1.3262033462524414e-06,
          "grad_norm": 0.3828125,
          "learning_rate": 6e-06,
          "num_tokens": 318967.0,
          "completions/mean_length": 490.125,
          "completions/min_length": 265.0,
          "completions/max_length": 925.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 428.0000305175781,
          "completions/min_terminated_length": 265.0,
          "completions/max_terminated_length": 781.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.03448275849223137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6108242273330688,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.002814680337905884,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.440828800201416,
          "reward_std": 0.41787728667259216,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.01661260286346078,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 333.5141935849979,
          "entropy_control/entropy": 0.01655680273067031,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 215.193628,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 237.129194,
          "forward_backward_time": 96.257753,
          "rollout_overhead_time": 21.935566
        },
        {
          "step": 22,
          "loss": -0.000545695424079895,
          "grad_norm": 0.330078125,
          "learning_rate": 5.8e-06,
          "entropy": 0.017196238273754716,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0011980830458924174,
          "clip_ratio/high_max": 0.0011980830458924174,
          "clip_ratio/region_mean": 0.0011980830458924174,
          "step_time": 96.38356308099901,
          "entropy_control/entropy": 0.01702333176424779,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 96.262762,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.00044046342372894287,
          "grad_norm": 0.16015625,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 344242.0,
          "completions/mean_length": 269.875,
          "completions/min_length": 238.0,
          "completions/max_length": 391.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 269.875,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 391.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.17142857611179352,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6148279905319214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0008064718567766249,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8294905424118042,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.501989686403249e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9419509172439575,
          "reward_std": 0.11144879460334778,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.042385022912640125,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 245.29134741899816,
          "entropy_control/entropy": 0.04561349127379264,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 143.773406,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 162.690954,
          "forward_backward_time": 82.476143,
          "rollout_overhead_time": 18.917548
        },
        {
          "step": 24,
          "loss": 0.00047101080417633057,
          "grad_norm": 0.1357421875,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.04200521484017372,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0020697777217719704,
          "clip_ratio/high_max": 0.0020697777217719704,
          "clip_ratio/region_mean": 0.0020697777217719704,
          "step_time": 82.59226387000035,
          "entropy_control/entropy": 0.045218182585161575,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.471461,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": -9.89530235528946e-09,
          "grad_norm": 0.173828125,
          "learning_rate": 5.2e-06,
          "num_tokens": 371488.0,
          "completions/mean_length": 311.75,
          "completions/min_length": 250.0,
          "completions/max_length": 375.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 311.75,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 375.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.12903225421905518,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6115735769271851,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 7.555148613391793e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6130543947219849,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0014879548689350486,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8341889977455139,
          "reward_std": 0.008876294828951359,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04961282107979059,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 277.141689441999,
          "entropy_control/entropy": 0.05045514122645926,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 168.794268,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 188.926659,
          "forward_backward_time": 88.100639,
          "rollout_overhead_time": 20.132391
        },
        {
          "step": 26,
          "loss": -0.00029454356990754604,
          "grad_norm": 0.10595703125,
          "learning_rate": 5e-06,
          "entropy": 0.049299571895971894,
          "clip_ratio/low_mean": 0.0019183356780558825,
          "clip_ratio/low_min": 0.0019183356780558825,
          "clip_ratio/high_mean": 0.0013235294609330595,
          "clip_ratio/high_max": 0.0013235294609330595,
          "clip_ratio/region_mean": 0.003241865138988942,
          "step_time": 88.20175407399893,
          "entropy_control/entropy": 0.05016574730078988,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 88.088165,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": 7.271557115018368e-05,
          "grad_norm": 0.2138671875,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 400961.0,
          "completions/mean_length": 377.625,
          "completions/min_length": 252.0,
          "completions/max_length": 603.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 377.625,
          "completions/min_terminated_length": 252.0,
          "completions/max_terminated_length": 603.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6162011623382568,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.1866166005347623e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8260114789009094,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.00435878848657012,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9461063146591187,
          "reward_std": 0.10377224534749985,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05742222792468965,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 251.29658381099944,
          "entropy_control/entropy": 0.05643979459697434,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 143.217945,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 163.201814,
          "forward_backward_time": 87.985604,
          "rollout_overhead_time": 19.983869
        },
        {
          "step": 28,
          "loss": -0.00024202116765081882,
          "grad_norm": 0.09814453125,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.05681797885335982,
          "clip_ratio/low_mean": 0.0006218905473360792,
          "clip_ratio/low_min": 0.0006218905473360792,
          "clip_ratio/high_mean": 0.002575607068138197,
          "clip_ratio/high_max": 0.002575607068138197,
          "clip_ratio/region_mean": 0.0031974976154742762,
          "step_time": 87.88071318700077,
          "entropy_control/entropy": 0.05581093909786784,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.766821,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": 2.9802322387695312e-08,
          "grad_norm": 0.08056640625,
          "learning_rate": 4.4e-06,
          "num_tokens": 430422.0,
          "completions/mean_length": 396.125,
          "completions/min_length": 234.0,
          "completions/max_length": 857.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 396.125,
          "completions/min_terminated_length": 234.0,
          "completions/max_terminated_length": 857.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6086075305938721,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.34096160531044006,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18192321062088013,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5352011919021606,
          "reward_std": 0.4017886817455292,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04723928542807698,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 316.6319273319996,
          "entropy_control/entropy": 0.03989102720396147,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 203.490923,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 224.434911,
          "forward_backward_time": 92.086401,
          "rollout_overhead_time": 20.943988
        },
        {
          "step": 30,
          "loss": -8.894503116607666e-05,
          "grad_norm": 0.064453125,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.047549558454193175,
          "clip_ratio/low_mean": 0.0011081278935307637,
          "clip_ratio/low_min": 0.0011081278935307637,
          "clip_ratio/high_mean": 0.00021222411305643618,
          "clip_ratio/high_max": 0.00021222411305643618,
          "clip_ratio/region_mean": 0.0013203520065871999,
          "step_time": 92.2031235839977,
          "entropy_control/entropy": 0.040190997737661806,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 92.090239,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.00014733633724972606,
          "grad_norm": 0.15234375,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 458054.0,
          "completions/mean_length": 366.5,
          "completions/min_length": 245.0,
          "completions/max_length": 875.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 366.5,
          "completions/min_terminated_length": 245.0,
          "completions/max_terminated_length": 875.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.744084894657135,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.22995175421237946,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13908715546131134,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.9097099304199219,
          "reward_std": 0.37770724296569824,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.020744612906128168,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 290.5032301099991,
          "entropy_control/entropy": 0.02546891146378123,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 197.472944,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 215.364881,
          "forward_backward_time": 75.02767,
          "rollout_overhead_time": 17.891936
        },
        {
          "step": 32,
          "loss": 0.00017066244618035853,
          "grad_norm": 0.1630859375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.020651699567679316,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0012177512398920953,
          "clip_ratio/high_max": 0.0012177512398920953,
          "clip_ratio/region_mean": 0.0012177512398920953,
          "step_time": 75.1522636180016,
          "entropy_control/entropy": 0.025430285065361977,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 75.043663,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.00014857196947559714,
          "grad_norm": 0.5546875,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 483745.0,
          "completions/mean_length": 311.875,
          "completions/min_length": 260.0,
          "completions/max_length": 408.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 311.875,
          "completions/min_terminated_length": 260.0,
          "completions/max_terminated_length": 408.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6119922995567322,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.5102457382454304e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8293945789337158,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.001506144879385829,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9415267705917358,
          "reward_std": 0.12078285962343216,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07779017789289355,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 263.0930055120007,
          "entropy_control/entropy": 0.07918635040678239,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 160.597135,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 179.652276,
          "forward_backward_time": 83.324273,
          "rollout_overhead_time": 19.055141
        },
        {
          "step": 34,
          "loss": -0.0004045320674777031,
          "grad_norm": 0.248046875,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.07796472008340061,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0020050798484589905,
          "clip_ratio/high_max": 0.0020050798484589905,
          "clip_ratio/region_mean": 0.0020050798484589905,
          "step_time": 83.42563158399844,
          "entropy_control/entropy": 0.07932321980524848,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.313219,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.062484174966812134,
          "grad_norm": 0.2158203125,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 518902.0,
          "completions/mean_length": 527.625,
          "completions/min_length": 217.0,
          "completions/max_length": 972.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 464.14288330078125,
          "completions/min_terminated_length": 217.0,
          "completions/max_terminated_length": 758.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0714285746216774,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3409881293773651,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.16847732663154602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1041666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19795581698417664,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.9258201122283936,
          "reward": 0.246196448802948,
          "reward_std": 0.3632914125919342,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.019984100246801972,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 343.58754661199964,
          "entropy_control/entropy": 0.024188085687493994,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 224.77326,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 246.9039,
          "forward_backward_time": 96.566652,
          "rollout_overhead_time": 22.13064
        },
        {
          "step": 36,
          "loss": -0.06240898370742798,
          "grad_norm": 0.1767578125,
          "learning_rate": 3e-06,
          "entropy": 0.019961558049544692,
          "clip_ratio/low_mean": 0.002036069316091016,
          "clip_ratio/low_min": 0.002036069316091016,
          "clip_ratio/high_mean": 0.00020161290012765676,
          "clip_ratio/high_max": 0.00020161290012765676,
          "clip_ratio/region_mean": 0.0022376822162186727,
          "step_time": 96.65855460000057,
          "entropy_control/entropy": 0.024303713555688736,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 96.552414,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.00022276118397712708,
          "grad_norm": 0.1337890625,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 544877.0,
          "completions/mean_length": 362.875,
          "completions/min_length": 257.0,
          "completions/max_length": 611.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 362.875,
          "completions/min_terminated_length": 257.0,
          "completions/max_terminated_length": 611.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.3529411852359772,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.615119218826294,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0009891889058053493,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6181600093841553,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 1.0589964176688227e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.843722939491272,
          "reward_std": 0.010307898744940758,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06896448787301779,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 270.79194448,
          "entropy_control/entropy": 0.06577244641272037,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 167.833593,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 186.991626,
          "forward_backward_time": 83.689616,
          "rollout_overhead_time": 19.158032
        },
        {
          "step": 38,
          "loss": -0.0005158446729183197,
          "grad_norm": 0.123046875,
          "learning_rate": 2.6e-06,
          "entropy": 0.0692716515623033,
          "clip_ratio/low_mean": 0.0011267974332440645,
          "clip_ratio/low_min": 0.0011267974332440645,
          "clip_ratio/high_mean": 0.0018399592663627118,
          "clip_ratio/high_max": 0.0018399592663627118,
          "clip_ratio/region_mean": 0.0029667566996067762,
          "step_time": 83.78387444800137,
          "entropy_control/entropy": 0.06597887336379939,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.676588,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.00022244127467274666,
          "grad_norm": 0.1376953125,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 572401.0,
          "completions/mean_length": 345.5,
          "completions/min_length": 261.0,
          "completions/max_length": 436.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 345.5,
          "completions/min_terminated_length": 261.0,
          "completions/max_terminated_length": 436.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.4000000059604645,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6180810928344727,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0004928380949422717,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.07715168595314026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8493311405181885,
          "reward_std": 0.0041687930934131145,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07258317992091179,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 195.94552210799975,
          "entropy_control/entropy": 0.07133666538272915,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 115.964442,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 131.192693,
          "forward_backward_time": 64.650655,
          "rollout_overhead_time": 15.22825
        },
        {
          "step": 40,
          "loss": 0.0003291212487965822,
          "grad_norm": 0.162109375,
          "learning_rate": 2.2e-06,
          "entropy": 0.07260472676716745,
          "clip_ratio/low_mean": 0.0007578451477456838,
          "clip_ratio/low_min": 0.0007578451477456838,
          "clip_ratio/high_mean": 0.0038300505839288235,
          "clip_ratio/high_max": 0.0038300505839288235,
          "clip_ratio/region_mean": 0.004587895731674507,
          "step_time": 64.75038468500134,
          "entropy_control/entropy": 0.07133906537595829,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 64.643563,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.0001470815623179078,
          "grad_norm": 0.1572265625,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 603510.0,
          "completions/mean_length": 407.625,
          "completions/min_length": 273.0,
          "completions/max_length": 694.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 407.625,
          "completions/min_terminated_length": 273.0,
          "completions/max_terminated_length": 694.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6172691583633423,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 1.3644126966028125e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5252507925033569,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1835046112537384,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7462599277496338,
          "reward_std": 0.2814081013202667,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0738231724826619,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 260.5962830739991,
          "entropy_control/entropy": 0.0669646793525761,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 157.18409,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 176.584739,
          "forward_backward_time": 83.907308,
          "rollout_overhead_time": 19.400649
        },
        {
          "step": 42,
          "loss": 0.0007077767513692379,
          "grad_norm": 0.49609375,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.07389897236134857,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0009240323852282017,
          "clip_ratio/high_max": 0.0009240323852282017,
          "clip_ratio/region_mean": 0.0009240323852282017,
          "step_time": 84.02459510299923,
          "entropy_control/entropy": 0.06693753250717527,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.915515,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": 1.516193151473999e-06,
          "grad_norm": 0.291015625,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 632765.0,
          "completions/mean_length": 348.875,
          "completions/min_length": 265.0,
          "completions/max_length": 457.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 348.875,
          "completions/min_terminated_length": 265.0,
          "completions/max_terminated_length": 457.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.29629629850387573,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6178746223449707,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0008552604122087359,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6169817447662354,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0007432500715367496,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8476365208625793,
          "reward_std": 0.00494955200701952,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07686966517940164,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 208.75057098300022,
          "entropy_control/entropy": 0.07832597108465249,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 121.30173,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 138.014003,
          "forward_backward_time": 70.635289,
          "rollout_overhead_time": 16.712273
        },
        {
          "step": 44,
          "loss": -0.0003779083490371704,
          "grad_norm": 0.1865234375,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.07664299523457885,
          "clip_ratio/low_mean": 0.0007155550993047655,
          "clip_ratio/low_min": 0.0007155550993047655,
          "clip_ratio/high_mean": 0.003679176967125386,
          "clip_ratio/high_max": 0.003679176967125386,
          "clip_ratio/region_mean": 0.0043947320664301515,
          "step_time": 70.72571368899844,
          "entropy_control/entropy": 0.07810436976089705,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 70.627355,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": -3.8817524909973145e-06,
          "grad_norm": 0.193359375,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 665829.0,
          "completions/mean_length": 459.0,
          "completions/min_length": 287.0,
          "completions/max_length": 639.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 459.0,
          "completions/min_terminated_length": 287.0,
          "completions/max_terminated_length": 639.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.1428571492433548,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3412134647369385,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18242695927619934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6146758198738098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0014483736595138907,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.5456529855728149,
          "reward_std": 0.41048502922058105,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05643290979787707,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 289.95140555000035,
          "entropy_control/entropy": 0.05734015628450203,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 193.896552,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 212.203438,
          "forward_backward_time": 77.64727,
          "rollout_overhead_time": 18.306887
        },
        {
          "step": 46,
          "loss": 0.0005619600415229797,
          "grad_norm": 0.251953125,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.056736917700618505,
          "clip_ratio/low_mean": 0.0010034948209067807,
          "clip_ratio/low_min": 0.0010034948209067807,
          "clip_ratio/high_mean": 0.002066292188828811,
          "clip_ratio/high_max": 0.002066292188828811,
          "clip_ratio/region_mean": 0.0030697870097355917,
          "step_time": 77.75101602400173,
          "entropy_control/entropy": 0.05755260381565072,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 77.654512,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.00021885125897824764,
          "grad_norm": 0.3203125,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 694625.0,
          "completions/mean_length": 309.0,
          "completions/min_length": 238.0,
          "completions/max_length": 364.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 309.0,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 364.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.05000000074505806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6166108846664429,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.3838036920788e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8314213752746582,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0010649171890690923,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9542244672775269,
          "reward_std": 0.11163643002510071,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08227347710635513,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 191.2153643629972,
          "entropy_control/entropy": 0.08541661103700529,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 100.440939,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 117.617273,
          "forward_backward_time": 73.502514,
          "rollout_overhead_time": 17.176334
        },
        {
          "step": 48,
          "loss": -0.00024396576918661594,
          "grad_norm": 0.138671875,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.08149674907326698,
          "clip_ratio/low_mean": 0.0005252101109363139,
          "clip_ratio/low_min": 0.0005252101109363139,
          "clip_ratio/high_mean": 0.0033328040735796094,
          "clip_ratio/high_max": 0.0033328040735796094,
          "clip_ratio/region_mean": 0.0038580141845159233,
          "step_time": 73.5989647940005,
          "entropy_control/entropy": 0.08463391225243246,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.500912,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": 6.984919309616089e-09,
          "grad_norm": 0.1298828125,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 723945.0,
          "completions/mean_length": 370.0,
          "completions/min_length": 244.0,
          "completions/max_length": 651.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 370.0,
          "completions/min_terminated_length": 244.0,
          "completions/max_terminated_length": 651.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5234451293945312,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.18229824304580688,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8265383839607239,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.6115315020215348e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.844783365726471,
          "reward_std": 0.3357786536216736,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.036323420819826424,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 274.59873056799916,
          "entropy_control/entropy": 0.0429283501309586,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 176.057319,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 194.636102,
          "forward_backward_time": 79.864304,
          "rollout_overhead_time": 18.578783
        },
        {
          "step": 50,
          "loss": 7.894332520663738e-05,
          "grad_norm": 0.087890625,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.036797207430936396,
          "clip_ratio/low_mean": 0.0014213859685696661,
          "clip_ratio/low_min": 0.0014213859685696661,
          "clip_ratio/high_mean": 0.0018518302822485566,
          "clip_ratio/high_max": 0.0018518302822485566,
          "clip_ratio/region_mean": 0.0032732162508182228,
          "step_time": 79.95465855900147,
          "entropy_control/entropy": 0.04327416916451558,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.856897,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6155619431579329,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 273,
          "reward_channels": {
            "native": 0.6155619431579329,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.615560891281058,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 343,
          "reward_channels": {
            "native": 0.615560891281058,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6155606664493392,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 252,
          "reward_channels": {
            "native": 0.6155606664493392,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6164592739162532,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 274,
          "reward_channels": {
            "native": 0.6164592739162532,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6175072328484663,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 273,
          "reward_channels": {
            "native": 0.6175072328484663,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6175057798087202,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 298,
          "reward_channels": {
            "native": 0.6175057798087202,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6175061121677046,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 298,
          "reward_channels": {
            "native": 0.6175061121677046,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6175069963866499,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6175069963866499,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6169302065811881,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 320,
          "reward_channels": {
            "native": 0.6169302065811881,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6184861076618522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 268,
          "reward_channels": {
            "native": 0.6184861076618522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6184856035464226,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 258,
          "reward_channels": {
            "native": 0.6184856035464226,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.618486948443024,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 872,
          "reward_channels": {
            "native": 0.618486948443024,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6176954349414234,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 243,
          "reward_channels": {
            "native": 0.6176954349414234,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6176957130694314,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.6176957130694314,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6184896583035329,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 409,
          "reward_channels": {
            "native": 0.6184896583035329,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6184886158270289,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 341,
          "reward_channels": {
            "native": 0.6184886158270289,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 723,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6201801608919191,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 421,
          "reward_channels": {
            "native": 0.6201801608919191,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 594,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6182885244004738,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 562,
          "reward_channels": {
            "native": 0.6182885244004738,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6185548230263636,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 583,
          "reward_channels": {
            "native": 0.6185548230263636,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6207064180086292,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 392,
          "reward_channels": {
            "native": 0.6207064180086292,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6207075640003088,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 406,
          "reward_channels": {
            "native": 0.6207075640003088,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6207058199470863,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 685,
          "reward_channels": {
            "native": 0.6207058199470863,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6175192419545681,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 291,
          "reward_channels": {
            "native": 0.6175192419545681,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6167561987402518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.6167561987402518,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6175174288668923,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 335,
          "reward_channels": {
            "native": 0.6175174288668923,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6167551775519118,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 367,
          "reward_channels": {
            "native": 0.6167551775519118,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6168364043457519,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 273,
          "reward_channels": {
            "native": 0.6168364043457519,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.616834342416455,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 503,
          "reward_channels": {
            "native": 0.616834342416455,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6168348950551854,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 324,
          "reward_channels": {
            "native": 0.6168348950551854,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6154729421455175,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6154729421455175,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8346269127250262,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 307,
          "reward_channels": {
            "native": 0.8346269127250262,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8346271191178777,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 319,
          "reward_channels": {
            "native": 0.8346271191178777,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8346283987501825,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 333,
          "reward_channels": {
            "native": 0.8346283987501825,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8346278914886784,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 302,
          "reward_channels": {
            "native": 0.8346278914886784,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8316970841532554,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 351,
          "reward_channels": {
            "native": 0.8316970841532554,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8316978576102672,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 317,
          "reward_channels": {
            "native": 0.8316978576102672,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8316978253037827,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 351,
          "reward_channels": {
            "native": 0.8316978253037827,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8307404175709702,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8307404175709702,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789152686",
      "mode": "no-think",
      "method": "dapo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.6519488525390625,
      "train_last10": 0.7141775667667389,
      "holdout_native": 0.646690062246073,
      "holdout_episodes": 40,
      "holdout_successes": 39,
      "mean_step_seconds": 176.37912706865995,
      "label": "DAPO",
      "state_at_cutoff": "complete",
      "step_hours": 2.4497100981758324,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.646690062246073,
        "efficiency": 0.5791666666666667,
        "reliability": 0.95
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "585b3af741dbe64511cb6be1c1f1b58f5386ec0fa897b7ce4da57439318d1327",
        "entropy_holdout_episodes.jsonl": "413cfe0af0e836728d41fa258792fb938cfdb5a93d80e3eb5293f24b9b3ed42b",
        "resolved_training_config.json": "1629d5372941013330db5b2061b5713115746e4b1feb94b8552b37f64d0240e3"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.3692533075809479,
          "grad_norm": 0.177734375,
          "learning_rate": 1e-05,
          "num_tokens": 27996.0,
          "completions/mean_length": 603.0,
          "completions/min_length": 278.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 603.0,
          "completions/min_terminated_length": 278.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5008535981178284,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.21723572909832,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.3369031250476837,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3238062560558319,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.4792949855327606,
          "reward_std": 0.45436012744903564,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04867766337702051,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 340.52523792299996,
          "entropy_control/entropy": 0.03031625726079178,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 237.549989,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 257.894146,
          "forward_backward_time": 82.543066,
          "rollout_overhead_time": 20.344157
        },
        {
          "step": 2,
          "loss": 0.3688158392906189,
          "grad_norm": 0.1240234375,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.048358485801145434,
          "clip_ratio/low_mean": 0.0006929489754838869,
          "clip_ratio/low_min": 0.0006929489754838869,
          "clip_ratio/high_mean": 0.0011890835303347558,
          "clip_ratio/high_max": 0.0011890835303347558,
          "clip_ratio/region_mean": 0.0018820325058186427,
          "step_time": 82.57729190400005,
          "entropy_control/entropy": 0.030192915657265968,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.483635,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": -6.873492384329438e-05,
          "grad_norm": 0.00157928466796875,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 52250.0,
          "completions/mean_length": 315.75,
          "completions/min_length": 268.0,
          "completions/max_length": 441.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 315.75,
          "completions/min_terminated_length": 268.0,
          "completions/max_terminated_length": 441.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6156482696533203,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0003735041245818138,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8323149681091309,
          "reward_std": 0.0003735041245818138,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.073490837123245,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 225.7903535270002,
          "entropy_control/entropy": 0.07463982666444095,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 127.254493,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 145.6265,
          "forward_backward_time": 80.06869,
          "rollout_overhead_time": 18.372007
        },
        {
          "step": 4,
          "loss": -6.031058728694916e-05,
          "grad_norm": 0.002166748046875,
          "learning_rate": 9.4e-06,
          "entropy": 0.07436912599951029,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 80.15263358700031,
          "entropy_control/entropy": 0.07551235631313276,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.060743,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": -0.00023701813188381493,
          "grad_norm": 0.0037689208984375,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 76602.0,
          "completions/mean_length": 335.0,
          "completions/min_length": 298.0,
          "completions/max_length": 412.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 335.0,
          "completions/min_terminated_length": 298.0,
          "completions/max_terminated_length": 412.0,
          "tools/call_frequency": 4.5,
          "tools/failure_frequency": 0.1111111119389534,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6156157851219177,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 4.692983566201292e-05,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8322824239730835,
          "reward_std": 4.692983566201292e-05,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.09296132577583194,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 233.43878169599998,
          "entropy_control/entropy": 0.0943122746853232,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 134.944179,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 153.30447,
          "forward_backward_time": 80.030852,
          "rollout_overhead_time": 18.360291
        },
        {
          "step": 6,
          "loss": -0.00024486094480380416,
          "grad_norm": 0.003082275390625,
          "learning_rate": 9e-06,
          "entropy": 0.09225809015333652,
          "clip_ratio/low_mean": 0.0010964519169647247,
          "clip_ratio/low_min": 0.0010964519169647247,
          "clip_ratio/high_mean": 0.0012057877611368895,
          "clip_ratio/high_max": 0.0012057877611368895,
          "clip_ratio/region_mean": 0.002302239678101614,
          "step_time": 80.14518817899989,
          "entropy_control/entropy": 0.09359416556827227,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.040992,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.07327378541231155,
          "grad_norm": 0.2333984375,
          "learning_rate": 8.8e-06,
          "num_tokens": 107048.0,
          "completions/mean_length": 334.25,
          "completions/min_length": 247.0,
          "completions/max_length": 582.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 334.25,
          "completions/min_terminated_length": 247.0,
          "completions/max_terminated_length": 582.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3412603735923767,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1825207769870758,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6824637651443481,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2883092164993286,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.5201954245567322,
          "reward_std": 0.5074084997177124,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.026138133136555552,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 259.96634932300003,
          "entropy_control/entropy": 0.02442254099857785,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 164.944698,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 183.033936,
          "forward_backward_time": 76.835146,
          "rollout_overhead_time": 18.089238
        },
        {
          "step": 8,
          "loss": -0.07358121126890182,
          "grad_norm": 0.162109375,
          "learning_rate": 8.6e-06,
          "entropy": 0.026456466526724398,
          "clip_ratio/low_mean": 0.0005252101109363139,
          "clip_ratio/low_min": 0.0005252101109363139,
          "clip_ratio/high_mean": 0.0004180601972620934,
          "clip_ratio/high_max": 0.0004180601972620934,
          "clip_ratio/region_mean": 0.0009432703081984073,
          "step_time": 76.91976198899988,
          "entropy_control/entropy": 0.024563744591242016,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 76.824628,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.18830087780952454,
          "grad_norm": 0.0986328125,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 138420.0,
          "completions/mean_length": 633.5,
          "completions/min_length": 286.0,
          "completions/max_length": 924.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 633.5,
          "completions/min_terminated_length": 286.0,
          "completions/max_terminated_length": 924.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.3922732174396515,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2508854866027832,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3410886824131012,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1821773648262024,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.3229309320449829,
          "reward_std": 0.4192386567592621,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.026950508821755648,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 326.76431794399923,
          "entropy_control/entropy": 0.018794556699214083,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 213.805217,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 234.773073,
          "forward_backward_time": 91.891128,
          "rollout_overhead_time": 20.967856
        },
        {
          "step": 10,
          "loss": 0.18811774253845215,
          "grad_norm": 0.08203125,
          "learning_rate": 8.2e-06,
          "entropy": 0.02686283423099667,
          "clip_ratio/low_mean": 0.0011273209820501506,
          "clip_ratio/low_min": 0.0011273209820501506,
          "clip_ratio/high_mean": 0.00021186440426390618,
          "clip_ratio/high_max": 0.00021186440426390618,
          "clip_ratio/region_mean": 0.0013391853863140568,
          "step_time": 91.97408711800017,
          "entropy_control/entropy": 0.018791692803420808,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.873202,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.17540164291858673,
          "grad_norm": 0.173828125,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 168150.0,
          "completions/mean_length": 403.25,
          "completions/min_length": 269.0,
          "completions/max_length": 771.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 403.25,
          "completions/min_terminated_length": 269.0,
          "completions/max_terminated_length": 771.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.4943929612636566,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.21344728767871857,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6113900542259216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0027538298163563013,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7205997705459595,
          "reward_std": 0.30162128806114197,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0341033375589177,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 273.963373522,
          "entropy_control/entropy": 0.03113980793012608,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 176.041426,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 194.856423,
          "forward_backward_time": 78.9992,
          "rollout_overhead_time": 18.814997
        },
        {
          "step": 12,
          "loss": 0.175516739487648,
          "grad_norm": 0.171875,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.03414776746649295,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.00020833333837799728,
          "clip_ratio/high_max": 0.00020833333837799728,
          "clip_ratio/region_mean": 0.00020833333837799728,
          "step_time": 79.09812102199976,
          "entropy_control/entropy": 0.031178688400708438,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.99074,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": 0.2720063328742981,
          "grad_norm": 0.173828125,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 197090.0,
          "completions/mean_length": 328.5,
          "completions/min_length": 236.0,
          "completions/max_length": 743.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 328.5,
          "completions/min_terminated_length": 236.0,
          "completions/max_terminated_length": 743.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.03333333507180214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5028147101402283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2185431271791458,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.3326573371887207,
          "reward_std": 0.41158783435821533,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04868619958870113,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 287.9703269009997,
          "entropy_control/entropy": 0.048345302553217145,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 172.52584,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 193.699104,
          "forward_backward_time": 94.159163,
          "rollout_overhead_time": 21.173264
        },
        {
          "step": 14,
          "loss": 0.271788626909256,
          "grad_norm": 0.11669921875,
          "learning_rate": 7.4e-06,
          "entropy": 0.04911805596202612,
          "clip_ratio/low_mean": 0.00016823687474243343,
          "clip_ratio/low_min": 0.00016823687474243343,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00016823687474243343,
          "step_time": 94.26841234099993,
          "entropy_control/entropy": 0.0487854574763968,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 94.156891,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.33696749806404114,
          "grad_norm": 0.33203125,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 227675.0,
          "completions/mean_length": 335.625,
          "completions/min_length": 239.0,
          "completions/max_length": 613.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 335.625,
          "completions/min_terminated_length": 239.0,
          "completions/max_terminated_length": 613.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.34176012873649597,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18352025747299194,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8657005429267883,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08177393674850464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.6651886701583862,
          "reward_std": 0.5186328887939453,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.030811693228315562,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 247.40627943599975,
          "entropy_control/entropy": 0.03400098974383643,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 151.867485,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 170.110212,
          "forward_backward_time": 77.186803,
          "rollout_overhead_time": 18.242728
        },
        {
          "step": 16,
          "loss": -0.3372400104999542,
          "grad_norm": 0.32421875,
          "learning_rate": 7e-06,
          "entropy": 0.030748213626793586,
          "clip_ratio/low_mean": 0.00048449612222611904,
          "clip_ratio/low_min": 0.00048449612222611904,
          "clip_ratio/high_mean": 0.00044853356666862965,
          "clip_ratio/high_max": 0.00044853356666862965,
          "clip_ratio/region_mean": 0.0009330296888947487,
          "step_time": 77.28687519600044,
          "entropy_control/entropy": 0.03413712302972143,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 77.185206,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.15046238899230957,
          "grad_norm": 0.3046875,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 260344.0,
          "completions/mean_length": 388.625,
          "completions/min_length": 271.0,
          "completions/max_length": 587.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 388.625,
          "completions/min_terminated_length": 271.0,
          "completions/max_terminated_length": 587.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5247765779495239,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1831853687763214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6125996112823486,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0023507894948124886,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7395214438438416,
          "reward_std": 0.2787351608276367,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05782427568919957,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 254.2655020920006,
          "entropy_control/entropy": 0.0555637324306606,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 151.547989,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 170.920427,
          "forward_backward_time": 83.241832,
          "rollout_overhead_time": 19.372439
        },
        {
          "step": 18,
          "loss": -0.1504790335893631,
          "grad_norm": 0.173828125,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.05739053594879806,
          "clip_ratio/low_mean": 0.0008724388317205012,
          "clip_ratio/low_min": 0.0008724388317205012,
          "clip_ratio/high_mean": 0.00042517005931586027,
          "clip_ratio/high_max": 0.00042517005931586027,
          "clip_ratio/region_mean": 0.0012976088910363615,
          "step_time": 83.31394233899982,
          "entropy_control/entropy": 0.055122998891002195,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.211267,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.14910073578357697,
          "grad_norm": 0.291015625,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 286477.0,
          "completions/mean_length": 372.125,
          "completions/min_length": 255.0,
          "completions/max_length": 526.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 372.125,
          "completions/min_terminated_length": 255.0,
          "completions/max_terminated_length": 526.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6136557459831238,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0015253729652613401,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.394774854183197,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28954967856407166,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.5656735897064209,
          "reward_std": 0.43308326601982117,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.052682810463011265,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 272.061771614,
          "entropy_control/entropy": 0.048758424207517456,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 167.421362,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 187.098197,
          "forward_backward_time": 84.851514,
          "rollout_overhead_time": 19.676835
        },
        {
          "step": 20,
          "loss": 0.14920605719089508,
          "grad_norm": 0.2314453125,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.05313685396686196,
          "clip_ratio/low_mean": 0.0005488480965141207,
          "clip_ratio/low_min": 0.0005488480965141207,
          "clip_ratio/high_mean": 0.000469924823846668,
          "clip_ratio/high_max": 0.000469924823846668,
          "clip_ratio/region_mean": 0.0010187729203607887,
          "step_time": 84.94119402100023,
          "entropy_control/entropy": 0.04929954233653071,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 84.833103,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": 0.01824653148651123,
          "grad_norm": 0.19921875,
          "learning_rate": 6e-06,
          "num_tokens": 319256.0,
          "completions/mean_length": 394.375,
          "completions/min_length": 245.0,
          "completions/max_length": 666.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 394.375,
          "completions/min_terminated_length": 245.0,
          "completions/max_terminated_length": 666.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4329206645488739,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.21122044324874878,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5206031203269958,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.18040494620800018,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.5392618775367737,
          "reward_std": 0.4051787257194519,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.031799523741938174,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 277.84228195500054,
          "entropy_control/entropy": 0.03242920339025762,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 168.251986,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 188.42333,
          "forward_backward_time": 89.319367,
          "rollout_overhead_time": 20.171344
        },
        {
          "step": 22,
          "loss": 0.01798143982887268,
          "grad_norm": 0.171875,
          "learning_rate": 5.8e-06,
          "entropy": 0.03149362048134208,
          "clip_ratio/low_mean": 0.00037537538446485996,
          "clip_ratio/low_min": 0.00037537538446485996,
          "clip_ratio/high_mean": 0.0009347896557301283,
          "clip_ratio/high_max": 0.0009347896557301283,
          "clip_ratio/region_mean": 0.0013101650401949883,
          "step_time": 89.41478857799848,
          "entropy_control/entropy": 0.03225091970596338,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.308033,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.17221468687057495,
          "grad_norm": 0.1875,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 345422.0,
          "completions/mean_length": 381.25,
          "completions/min_length": 238.0,
          "completions/max_length": 748.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 381.25,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 748.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.09677419066429138,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.613832950592041,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0028983973897993565,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6828960180282593,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28859731554985046,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8171144723892212,
          "reward_std": 0.3262479603290558,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05550521705299616,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 269.0507772079991,
          "entropy_control/entropy": 0.04823267800406146,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 167.54063,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 186.482361,
          "forward_backward_time": 82.463555,
          "rollout_overhead_time": 18.941731
        },
        {
          "step": 24,
          "loss": 0.17187626659870148,
          "grad_norm": 0.146484375,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.055170910665765405,
          "clip_ratio/low_mean": 0.0012920362350996584,
          "clip_ratio/low_min": 0.0012920362350996584,
          "clip_ratio/high_mean": 0.001443713903427124,
          "clip_ratio/high_max": 0.001443713903427124,
          "clip_ratio/region_mean": 0.0027357501385267824,
          "step_time": 82.55980333700063,
          "entropy_control/entropy": 0.048020255119890526,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.453754,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": 0.036988019943237305,
          "grad_norm": 0.353515625,
          "learning_rate": 5.2e-06,
          "num_tokens": 372580.0,
          "completions/mean_length": 300.75,
          "completions/min_length": 265.0,
          "completions/max_length": 356.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 300.75,
          "completions/min_terminated_length": 265.0,
          "completions/max_terminated_length": 356.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.14814814925193787,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6139856576919556,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0010810233652591705,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6145153045654297,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.001134276739321649,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8402920961380005,
          "reward_std": 0.009312445297837257,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0713640390895307,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 246.0319621259996,
          "entropy_control/entropy": 0.0702834473347908,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 138.623042,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 158.496741,
          "forward_backward_time": 87.430078,
          "rollout_overhead_time": 19.873699
        },
        {
          "step": 26,
          "loss": 0.036650970578193665,
          "grad_norm": 0.330078125,
          "learning_rate": 5e-06,
          "entropy": 0.07126661529764533,
          "clip_ratio/low_mean": 0.0003511235991027206,
          "clip_ratio/low_min": 0.0003511235991027206,
          "clip_ratio/high_mean": 0.0012477763812057674,
          "clip_ratio/high_max": 0.0012477763812057674,
          "clip_ratio/region_mean": 0.001598899980308488,
          "step_time": 87.54783761100043,
          "entropy_control/entropy": 0.07012220591020303,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.441913,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.2653420865535736,
          "grad_norm": 0.1025390625,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 405260.0,
          "completions/mean_length": 778.5,
          "completions/min_length": 316.0,
          "completions/max_length": 1940.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 778.5,
          "completions/min_terminated_length": 316.0,
          "completions/max_terminated_length": 1940.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.502800464630127,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.21853949129581451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.2994753420352936,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.20206774771213531,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.4136379063129425,
          "reward_std": 0.44966861605644226,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.03606779675465077,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 434.5469909829999,
          "entropy_control/entropy": 0.023290043880667306,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 323.716093,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 344.14945,
          "forward_backward_time": 90.298629,
          "rollout_overhead_time": 20.433357
        },
        {
          "step": 28,
          "loss": 0.26548078656196594,
          "grad_norm": 0.1162109375,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.03613937651971355,
          "clip_ratio/low_mean": 0.0008235201530624181,
          "clip_ratio/low_min": 0.0008235201530624181,
          "clip_ratio/high_mean": 0.0007868059328757226,
          "clip_ratio/high_max": 0.0007868059328757226,
          "clip_ratio/region_mean": 0.0016103260859381407,
          "step_time": 90.39110960100152,
          "entropy_control/entropy": 0.02332148559095522,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 90.289309,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.0823657289147377,
          "grad_norm": 0.10009765625,
          "learning_rate": 4.4e-06,
          "num_tokens": 434741.0,
          "completions/mean_length": 398.625,
          "completions/min_length": 250.0,
          "completions/max_length": 742.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 398.625,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 742.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6098519563674927,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.183618792310881e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3412742018699646,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1825484037399292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5359797477722168,
          "reward_std": 0.4024333357810974,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04406218009535223,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 309.39598267899873,
          "entropy_control/entropy": 0.03689289156406395,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 194.145289,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 215.223729,
          "forward_backward_time": 94.070809,
          "rollout_overhead_time": 21.07844
        },
        {
          "step": 30,
          "loss": -0.08245766907930374,
          "grad_norm": 0.0908203125,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.043836229597218335,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 94.16109022100045,
          "entropy_control/entropy": 0.036719057926245253,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 94.057874,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.22658193111419678,
          "grad_norm": 0.1318359375,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 463118.0,
          "completions/mean_length": 459.625,
          "completions/min_length": 273.0,
          "completions/max_length": 1194.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 459.625,
          "completions/min_terminated_length": 273.0,
          "completions/max_terminated_length": 1194.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6656099557876587,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3028259575366974,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.29546844959259033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.9258201122283936,
          "reward": 0.7864433526992798,
          "reward_std": 0.500939130783081,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.053054060554131866,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 290.2619876309991,
          "entropy_control/entropy": 0.042977884104551334,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 189.00532,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 207.787733,
          "forward_backward_time": 82.369938,
          "rollout_overhead_time": 18.782413
        },
        {
          "step": 32,
          "loss": 0.22693459689617157,
          "grad_norm": 0.1474609375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.05277115071658045,
          "clip_ratio/low_mean": 0.0007332969398703426,
          "clip_ratio/low_min": 0.0007332969398703426,
          "clip_ratio/high_mean": 0.001598130736965686,
          "clip_ratio/high_max": 0.001598130736965686,
          "clip_ratio/region_mean": 0.0023314276768360287,
          "step_time": 82.46991769599936,
          "entropy_control/entropy": 0.04284019018248579,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.372028,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.26303285360336304,
          "grad_norm": 0.2890625,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 489378.0,
          "completions/mean_length": 383.0,
          "completions/min_length": 267.0,
          "completions/max_length": 849.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 383.0,
          "completions/min_terminated_length": 267.0,
          "completions/max_terminated_length": 849.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.13333334028720856,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6145089864730835,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.002659555757418275,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6661649942398071,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3274487555027008,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8122120499610901,
          "reward_std": 0.35481512546539307,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.099782669916749,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 271.0022347350023,
          "entropy_control/entropy": 0.08817868029873602,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 173.740596,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 192.280987,
          "forward_backward_time": 78.621158,
          "rollout_overhead_time": 18.540391
        },
        {
          "step": 34,
          "loss": 0.2627889811992645,
          "grad_norm": 0.26953125,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.09929254441522062,
          "clip_ratio/low_mean": 0.0004646840097848326,
          "clip_ratio/low_min": 0.0004646840097848326,
          "clip_ratio/high_mean": 0.00037202381645329297,
          "clip_ratio/high_max": 0.00037202381645329297,
          "clip_ratio/region_mean": 0.0008367078262381256,
          "step_time": 78.72165960399889,
          "entropy_control/entropy": 0.0879312352183957,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.616983,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.10388702899217606,
          "grad_norm": 0.1015625,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 525987.0,
          "completions/mean_length": 709.125,
          "completions/min_length": 281.0,
          "completions/max_length": 1039.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 709.125,
          "completions/min_terminated_length": 281.0,
          "completions/max_terminated_length": 1039.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.032258063554763794,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.2958386540412903,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1296512633562088,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1767766922712326,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.14896363019943237,
          "reward_std": 0.27991142868995667,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0200532489689067,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 312.12456131,
          "entropy_control/entropy": 0.014173528316416882,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 209.030083,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 228.521845,
          "forward_backward_time": 83.503519,
          "rollout_overhead_time": 19.491762
        },
        {
          "step": 36,
          "loss": 0.10383187979459763,
          "grad_norm": 0.06103515625,
          "learning_rate": 3e-06,
          "entropy": 0.019959633063990623,
          "clip_ratio/low_mean": 0.0001203079882543534,
          "clip_ratio/low_min": 0.0001203079882543534,
          "clip_ratio/high_mean": 0.0002659574383869767,
          "clip_ratio/high_max": 0.0002659574383869767,
          "clip_ratio/region_mean": 0.0003862654266413301,
          "step_time": 83.60138981300133,
          "entropy_control/entropy": 0.014069342739958808,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.504691,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.003299206495285034,
          "grad_norm": 0.1767578125,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 551569.0,
          "completions/mean_length": 313.75,
          "completions/min_length": 200.0,
          "completions/max_length": 463.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 313.75,
          "completions/min_terminated_length": 200.0,
          "completions/max_terminated_length": 463.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.4000000059604645,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6169520020484924,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.000885089801158756,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.618954598903656,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 9.291444484915701e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.84920334815979,
          "reward_std": 0.0068770782090723515,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07350466074422002,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 212.67323126400152,
          "entropy_control/entropy": 0.0739125223995948,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 111.956567,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 130.605717,
          "forward_backward_time": 81.966546,
          "rollout_overhead_time": 18.64915
        },
        {
          "step": 38,
          "loss": 0.00309772789478302,
          "grad_norm": 0.16796875,
          "learning_rate": 2.6e-06,
          "entropy": 0.07349386159330606,
          "clip_ratio/low_mean": 0.0007055184687487781,
          "clip_ratio/low_min": 0.0007055184687487781,
          "clip_ratio/high_mean": 0.0007942890515550971,
          "clip_ratio/high_max": 0.0007942890515550971,
          "clip_ratio/region_mean": 0.0014998075203038752,
          "step_time": 82.06627910099905,
          "entropy_control/entropy": 0.07389654169173025,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 81.967482,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.021948106586933136,
          "grad_norm": 0.228515625,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 578839.0,
          "completions/mean_length": 313.75,
          "completions/min_length": 247.0,
          "completions/max_length": 436.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 313.75,
          "completions/min_terminated_length": 247.0,
          "completions/max_terminated_length": 436.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.17391304671764374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.618468165397644,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.000908317684661597,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6041666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.08625821024179459,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8486765623092651,
          "reward_std": 0.005111454986035824,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08312045782804489,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 158.74121129800187,
          "entropy_control/entropy": 0.08195730024252483,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 82.87084,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 97.525424,
          "forward_backward_time": 61.113497,
          "rollout_overhead_time": 14.654584
        },
        {
          "step": 40,
          "loss": 0.02142183482646942,
          "grad_norm": 0.2041015625,
          "learning_rate": 2.2e-06,
          "entropy": 0.08254547649994493,
          "clip_ratio/low_mean": 0.0007418397581204772,
          "clip_ratio/low_min": 0.0007418397581204772,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0007418397581204772,
          "step_time": 61.216063511001266,
          "entropy_control/entropy": 0.08144057412950294,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 61.115791,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.02038617990911007,
          "grad_norm": 0.09619140625,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 610333.0,
          "completions/mean_length": 455.75,
          "completions/min_length": 264.0,
          "completions/max_length": 659.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 455.75,
          "completions/min_terminated_length": 264.0,
          "completions/max_terminated_length": 659.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6167720556259155,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 3.006737870236975e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5251070857048035,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1834070235490799,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7459396123886108,
          "reward_std": 0.28127336502075195,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04792513488791883,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 257.0219260349986,
          "entropy_control/entropy": 0.043204792956577386,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 153.105383,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 172.651199,
          "forward_backward_time": 84.269766,
          "rollout_overhead_time": 19.545815
        },
        {
          "step": 42,
          "loss": 0.020487722009420395,
          "grad_norm": 0.103515625,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.04826283315196633,
          "clip_ratio/low_mean": 0.00044802867341786623,
          "clip_ratio/low_min": 0.00044802867341786623,
          "clip_ratio/high_mean": 0.0006631661963183433,
          "clip_ratio/high_max": 0.0006631661963183433,
          "clip_ratio/region_mean": 0.0011111948697362095,
          "step_time": 84.34784766300072,
          "entropy_control/entropy": 0.04347036650723186,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 84.253063,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": 0.09651297330856323,
          "grad_norm": 0.154296875,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 639941.0,
          "completions/mean_length": 393.0,
          "completions/min_length": 258.0,
          "completions/max_length": 660.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 393.0,
          "completions/min_terminated_length": 258.0,
          "completions/max_terminated_length": 660.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6175951361656189,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0009088596561923623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5253363847732544,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.18355761468410492,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.7485491037368774,
          "reward_std": 0.2822871804237366,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06372657674364746,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 248.04164702799972,
          "entropy_control/entropy": 0.05962481169471561,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 151.149313,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 169.465944,
          "forward_backward_time": 78.475008,
          "rollout_overhead_time": 18.316631
        },
        {
          "step": 44,
          "loss": 0.09647795557975769,
          "grad_norm": 0.1494140625,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.06359893176704645,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 78.56714497000394,
          "entropy_control/entropy": 0.059532171890339464,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.470305,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": 0.14501114189624786,
          "grad_norm": 0.1962890625,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 673778.0,
          "completions/mean_length": 555.625,
          "completions/min_length": 309.0,
          "completions/max_length": 840.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 555.625,
          "completions/min_terminated_length": 309.0,
          "completions/max_terminated_length": 840.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4321771264076233,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.21036000549793243,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.524140477180481,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1827603131532669,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.5448254346847534,
          "reward_std": 0.40982091426849365,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05191244976595044,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 291.9126464979945,
          "entropy_control/entropy": 0.04314513979878438,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 182.660712,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 202.765055,
          "forward_backward_time": 89.049637,
          "rollout_overhead_time": 20.104343
        },
        {
          "step": 46,
          "loss": 0.14456185698509216,
          "grad_norm": 0.10009765625,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.05136946530546993,
          "clip_ratio/low_mean": 0.000510081197717227,
          "clip_ratio/low_min": 0.000510081197717227,
          "clip_ratio/high_mean": 0.0017875390622066334,
          "clip_ratio/high_max": 0.0017875390622066334,
          "clip_ratio/region_mean": 0.0022976202599238604,
          "step_time": 89.14526429899888,
          "entropy_control/entropy": 0.0426339945196989,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.046254,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.018097413703799248,
          "grad_norm": 0.08544921875,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 703353.0,
          "completions/mean_length": 406.375,
          "completions/min_length": 308.0,
          "completions/max_length": 603.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 379.71429443359375,
          "completions/min_terminated_length": 308.0,
          "completions/max_terminated_length": 603.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.14814814925193787,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6172248721122742,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.1022831358786789e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5410884618759155,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3361206352710724,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7031150460243225,
          "reward_std": 0.41348356008529663,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.049183032708242536,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 243.1568956810006,
          "entropy_control/entropy": 0.05395608048497949,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 132.256004,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 152.536721,
          "forward_backward_time": 90.521028,
          "rollout_overhead_time": 20.280717
        },
        {
          "step": 48,
          "loss": -0.01824425347149372,
          "grad_norm": 0.083984375,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.048936380771920085,
          "clip_ratio/low_mean": 0.0004145936982240528,
          "clip_ratio/low_min": 0.0004145936982240528,
          "clip_ratio/high_mean": 0.00032552084303461015,
          "clip_ratio/high_max": 0.00032552084303461015,
          "clip_ratio/region_mean": 0.0007401145412586629,
          "step_time": 90.61540986599903,
          "entropy_control/entropy": 0.0536625850921848,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 90.519903,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": -0.01925632357597351,
          "grad_norm": 0.1787109375,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 732287.0,
          "completions/mean_length": 321.75,
          "completions/min_length": 277.0,
          "completions/max_length": 382.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 321.75,
          "completions/min_terminated_length": 277.0,
          "completions/max_terminated_length": 382.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6156848669052124,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.5359042890850105e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8315935730934143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0012110897805541754,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9538475275039673,
          "reward_std": 0.11222782731056213,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08955142507329583,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 194.973901905998,
          "entropy_control/entropy": 0.09202889173549136,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 103.317614,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 120.437101,
          "forward_backward_time": 74.436733,
          "rollout_overhead_time": 17.119486
        },
        {
          "step": 50,
          "loss": -0.01872306317090988,
          "grad_norm": 0.1650390625,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.08925818745046854,
          "clip_ratio/low_mean": 0.0004448398540262133,
          "clip_ratio/low_min": 0.0004448398540262133,
          "clip_ratio/high_mean": 0.00037537538446485996,
          "clip_ratio/high_max": 0.00037537538446485996,
          "clip_ratio/region_mean": 0.0008202152384910733,
          "step_time": 74.52270755099926,
          "entropy_control/entropy": 0.09178309330982862,
          "entropy_control/target": 0.03031625726079178,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 74.429617,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.617827415078968,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 273,
          "reward_channels": {
            "native": 0.617827415078968,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6178268262001205,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 277,
          "reward_channels": {
            "native": 0.6178268262001205,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6178278680985384,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 295,
          "reward_channels": {
            "native": 0.6178278680985384,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6178281013971713,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 307,
          "reward_channels": {
            "native": 0.6178281013971713,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6177086905727631,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 224,
          "reward_channels": {
            "native": 0.6177086905727631,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6177077954531537,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 320,
          "reward_channels": {
            "native": 0.6177077954531537,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6177076480229584,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 294,
          "reward_channels": {
            "native": 0.6177076480229584,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6168370557757319,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 294,
          "reward_channels": {
            "native": 0.6168370557757319,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6196029689418718,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.6196029689418718,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6196020525787467,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 276,
          "reward_channels": {
            "native": 0.6196020525787467,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6196037362934148,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 350,
          "reward_channels": {
            "native": 0.6196037362934148,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6196031742367349,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 268,
          "reward_channels": {
            "native": 0.6196031742367349,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6194053855289625,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 333,
          "reward_channels": {
            "native": 0.6194053855289625,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6200496131721656,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 258,
          "reward_channels": {
            "native": 0.6200496131721656,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6200484743316188,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 252,
          "reward_channels": {
            "native": 0.6200484743316188,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6200497891838649,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 297,
          "reward_channels": {
            "native": 0.6200497891838649,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.618495692979087,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 726,
          "reward_channels": {
            "native": 0.618495692979087,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6207112328656104,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 446,
          "reward_channels": {
            "native": 0.6207112328656104,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6207140123110011,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 489,
          "reward_channels": {
            "native": 0.6207140123110011,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.62071255280854,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 550,
          "reward_channels": {
            "native": 0.62071255280854,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6222763451244105,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 446,
          "reward_channels": {
            "native": 0.6222763451244105,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6222766070858753,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 587,
          "reward_channels": {
            "native": 0.6222766070858753,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6222768966053871,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 394,
          "reward_channels": {
            "native": 0.6222768966053871,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6222726313160121,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 411,
          "reward_channels": {
            "native": 0.6222726313160121,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6182188046812087,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 302,
          "reward_channels": {
            "native": 0.6182188046812087,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 251,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6182191455836307,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 366,
          "reward_channels": {
            "native": 0.6182191455836307,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6182196745883963,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 353,
          "reward_channels": {
            "native": 0.6182196745883963,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6183858537745408,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6183858537745408,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6183862626624119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 314,
          "reward_channels": {
            "native": 0.6183862626624119,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6183844270508299,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.6183844270508299,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6183847253722361,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 331,
          "reward_channels": {
            "native": 0.6183847253722361,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8345685745689324,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 335,
          "reward_channels": {
            "native": 0.8345685745689324,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8345688851902214,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 363,
          "reward_channels": {
            "native": 0.8345688851902214,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.834567592653991,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 318,
          "reward_channels": {
            "native": 0.834567592653991,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8352183059394792,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 313,
          "reward_channels": {
            "native": 0.8352183059394792,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.832439310785638,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 345,
          "reward_channels": {
            "native": 0.832439310785638,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8333153584278061,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 345,
          "reward_channels": {
            "native": 0.8333153584278061,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8333146420131576,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 302,
          "reward_channels": {
            "native": 0.8333146420131576,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8324383605877279,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 444,
          "reward_channels": {
            "native": 0.8324383605877279,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789165288",
      "mode": "no-think",
      "method": "dapo-refill",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.6564315838118394,
      "train_last10": 0.7584913248817126,
      "holdout_native": 0.5839457972260582,
      "holdout_episodes": 40,
      "holdout_successes": 34,
      "mean_step_seconds": 223.9525490545201,
      "label": "DAPO-refill",
      "state_at_cutoff": "complete",
      "step_hours": 3.110452070201668,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 19.0,
      "groups_refilled": 16.0,
      "holdout_component_means": {
        "native": 0.5839457972260582,
        "efficiency": 0.37083333333333335,
        "reliability": 0.7
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": true,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "c38d539b34cbe05efd14d603ae07cb9e0c0e80ccd1d228f4042856dd6466aed5",
        "entropy_holdout_episodes.jsonl": "8f26e23909f81fa52ff519d31682cfc906fd7fcb9f104a97ccb5374f1892c87d",
        "resolved_training_config.json": "837029a3a7e45c5235cee2f925cc5ce8856cda8aff9f496a9d920a3f62b4f382"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.35472699999809265,
          "grad_norm": 0.1748046875,
          "learning_rate": 1e-05,
          "num_tokens": 28078.0,
          "completions/mean_length": 613.25,
          "completions/min_length": 278.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 613.25,
          "completions/min_terminated_length": 278.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5011641383171082,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.21744278073310852,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.33700618147850037,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3240123689174652,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.4795018434524536,
          "reward_std": 0.45456814765930176,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06061301758745685,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 333.8126870860002,
          "entropy_control/entropy": 0.038171986696735806,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 230.269955,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 250.540646,
          "forward_backward_time": 83.174382,
          "rollout_overhead_time": 20.270691
        },
        {
          "step": 2,
          "loss": 0.35448992252349854,
          "grad_norm": 0.1064453125,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.060262446582783014,
          "clip_ratio/low_mean": 0.0006929489754838869,
          "clip_ratio/low_min": 0.0006929489754838869,
          "clip_ratio/high_mean": 0.000953999362536706,
          "clip_ratio/high_max": 0.000953999362536706,
          "clip_ratio/region_mean": 0.001646948338020593,
          "step_time": 83.20406460700008,
          "entropy_control/entropy": 0.03790323962936314,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.104259,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.18107134103775024,
          "grad_norm": 0.265625,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 77061.0,
          "completions/mean_length": 348.9375,
          "completions/min_length": 270.0,
          "completions/max_length": 477.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 348.9375,
          "completions/min_terminated_length": 270.0,
          "completions/max_terminated_length": 477.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.08435708656907082,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5571814775466919,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15460200607776642,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3229166716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.10661446303129196,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.875,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.3535533845424652,
          "reward": 0.748327225446701,
          "reward_std": 0.23009877651929855,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.07343449490144849,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 422.89352600200027,
          "entropy_control/entropy": 0.07352014494481669,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 307.411631,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 342.455792,
          "forward_backward_time": 80.341637,
          "rollout_overhead_time": 35.044162
        },
        {
          "step": 4,
          "loss": 0.1805187314748764,
          "grad_norm": 0.197265625,
          "learning_rate": 9.4e-06,
          "entropy": 0.07333209784701467,
          "clip_ratio/low_mean": 0.0008283458300866187,
          "clip_ratio/low_min": 0.0008283458300866187,
          "clip_ratio/high_mean": 0.0016232220805250108,
          "clip_ratio/high_max": 0.0016232220805250108,
          "clip_ratio/region_mean": 0.0024515679106116295,
          "step_time": 80.6114583420001,
          "entropy_control/entropy": 0.07342028031964923,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.513781,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.22802186012268066,
          "grad_norm": 0.208984375,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 101505.0,
          "completions/mean_length": 346.5,
          "completions/min_length": 266.0,
          "completions/max_length": 728.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 346.5,
          "completions/min_terminated_length": 266.0,
          "completions/max_terminated_length": 728.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5583271384239197,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1548900455236435,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.13908715546131134,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7239521145820618,
          "reward_std": 0.3026461601257324,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07284741546027362,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 258.5455324069999,
          "entropy_control/entropy": 0.06509570859049835,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 167.327621,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 184.709988,
          "forward_backward_time": 73.736424,
          "rollout_overhead_time": 17.382367
        },
        {
          "step": 6,
          "loss": 0.22797930240631104,
          "grad_norm": 0.185546875,
          "learning_rate": 9e-06,
          "entropy": 0.07223051064647734,
          "clip_ratio/low_mean": 0.0008824660908430815,
          "clip_ratio/low_min": 0.0008824660908430815,
          "clip_ratio/high_mean": 0.0025362651504110545,
          "clip_ratio/high_max": 0.0025362651504110545,
          "clip_ratio/region_mean": 0.003418731241254136,
          "step_time": 73.84239936600011,
          "entropy_control/entropy": 0.06451345940291593,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.745749,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.18092216551303864,
          "grad_norm": 0.33984375,
          "learning_rate": 8.8e-06,
          "num_tokens": 164867.0,
          "completions/mean_length": 486.625,
          "completions/min_length": 240.0,
          "completions/max_length": 1010.5,
          "completions/clipped_ratio": 0.0625,
          "completions/mean_terminated_length": 453.96429443359375,
          "completions/min_terminated_length": 240.0,
          "completions/max_terminated_length": 1010.5,
          "tools/call_frequency": 3.6875,
          "tools/failure_frequency": 0.01666666753590107,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.384564109146595,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.18495657108724117,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.5773502588272095,
          "reward": 0.16936538740992546,
          "reward_std": 0.2429595785215497,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.021431849687360227,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.00027593818958848715,
          "clip_ratio/high_max": 0.00027593818958848715,
          "clip_ratio/region_mean": 0.00027593818958848715,
          "step_time": 574.8180244990001,
          "entropy_control/entropy": 0.020956970628637567,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 436.32049,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 478.264278,
          "forward_backward_time": 96.434945,
          "rollout_overhead_time": 41.943788
        },
        {
          "step": 8,
          "loss": 0.18057852983474731,
          "grad_norm": 0.22265625,
          "learning_rate": 8.6e-06,
          "entropy": 0.02112600638065487,
          "clip_ratio/low_mean": 0.0007281596481334418,
          "clip_ratio/low_min": 0.0007281596481334418,
          "clip_ratio/high_mean": 0.0015063803584780544,
          "clip_ratio/high_max": 0.0015063803584780544,
          "clip_ratio/region_mean": 0.002234540006611496,
          "step_time": 96.54974007300007,
          "entropy_control/entropy": 0.020737553577686675,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 96.431935,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.00012810673797503114,
          "grad_norm": 0.00579833984375,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 251261.0,
          "completions/mean_length": 314.4166666666667,
          "completions/min_length": 255.66666666666666,
          "completions/max_length": 510.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 314.4166666666667,
          "completions/min_terminated_length": 255.66666666666666,
          "completions/max_terminated_length": 510.0,
          "tools/call_frequency": 3.5833333333333335,
          "tools/failure_frequency": 0.01149425283074379,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6132153272628784,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.979118527136355e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4399409890174866,
          "reward_std": 0.4168644646803538,
          "frac_reward_zero_std": 0.6666666666666666,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 2.0,
          "n_refills": 2.0,
          "entropy": 0.08356596855446696,
          "clip_ratio/low_mean": 0.0003881987649947405,
          "clip_ratio/low_min": 0.0003881987649947405,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0003881987649947405,
          "step_time": 565.6080998629991,
          "entropy_control/entropy": 0.08513529738600786,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 410.810525,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 473.260004,
          "forward_backward_time": 92.248829,
          "rollout_overhead_time": 62.449479
        },
        {
          "step": 10,
          "loss": -0.000141437747515738,
          "grad_norm": 0.01019287109375,
          "learning_rate": 8.2e-06,
          "entropy": 0.08336706086993217,
          "clip_ratio/low_mean": 0.001187002082588151,
          "clip_ratio/low_min": 0.001187002082588151,
          "clip_ratio/high_mean": 0.0003846153849735856,
          "clip_ratio/high_max": 0.0003846153849735856,
          "clip_ratio/region_mean": 0.0015716174675617367,
          "step_time": 92.34179596000013,
          "entropy_control/entropy": 0.08494570650452599,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 92.239984,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": -0.010657824575901031,
          "grad_norm": 0.326171875,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 280258.0,
          "completions/mean_length": 311.625,
          "completions/min_length": 267.0,
          "completions/max_length": 361.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 311.625,
          "completions/min_terminated_length": 267.0,
          "completions/max_terminated_length": 361.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6160637140274048,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0016426424263045192,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6137489080429077,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0011741066118702292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8399062752723694,
          "reward_std": 0.00911726988852024,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.057969769928604364,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 218.35304513600022,
          "entropy_control/entropy": 0.05833197585289479,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 120.34968,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 139.021158,
          "forward_backward_time": 79.23106,
          "rollout_overhead_time": 18.671477
        },
        {
          "step": 12,
          "loss": -0.01145172119140625,
          "grad_norm": 0.287109375,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.05749161960557103,
          "clip_ratio/low_mean": 0.001531512476503849,
          "clip_ratio/low_min": 0.001531512476503849,
          "clip_ratio/high_mean": 0.0008183718600776047,
          "clip_ratio/high_max": 0.0008183718600776047,
          "clip_ratio/region_mean": 0.0023498843365814537,
          "step_time": 79.30637174300045,
          "entropy_control/entropy": 0.057858433400582165,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.207744,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": 0.010552559047937393,
          "grad_norm": 0.154296875,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 365944.0,
          "completions/mean_length": 279.5833333333333,
          "completions/min_length": 242.0,
          "completions/max_length": 338.3333333333333,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 279.5833333333333,
          "completions/min_terminated_length": 242.0,
          "completions/max_terminated_length": 338.3333333333333,
          "tools/call_frequency": 3.6666666666666665,
          "tools/failure_frequency": 0.06388889004786809,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6148615876833597,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.00035375153769715933,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3611111243565877,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.055555557211240135,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4414585630098979,
          "reward_std": 0.4185018142064412,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 2.0,
          "entropy": 0.08887322247028351,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0009293680195696652,
          "clip_ratio/high_max": 0.0009293680195696652,
          "clip_ratio/region_mean": 0.0009293680195696652,
          "step_time": 501.12077764199876,
          "entropy_control/entropy": 0.08723790235639847,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 344.869233,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 407.671669,
          "forward_backward_time": 93.346994,
          "rollout_overhead_time": 62.802436
        },
        {
          "step": 14,
          "loss": 0.010183563455939293,
          "grad_norm": 0.150390625,
          "learning_rate": 7.4e-06,
          "entropy": 0.08818746590986848,
          "clip_ratio/low_mean": 0.0008457895892206579,
          "clip_ratio/low_min": 0.0008457895892206579,
          "clip_ratio/high_mean": 0.0016981883090920746,
          "clip_ratio/high_max": 0.0016981883090920746,
          "clip_ratio/region_mean": 0.0025439778983127326,
          "step_time": 93.43431715799761,
          "entropy_control/entropy": 0.08655305600153379,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 93.332763,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": 0.20478859543800354,
          "grad_norm": 0.310546875,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 426178.0,
          "completions/mean_length": 280.625,
          "completions/min_length": 240.5,
          "completions/max_length": 435.5,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 280.625,
          "completions/min_terminated_length": 240.5,
          "completions/max_terminated_length": 435.5,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.684032142162323,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28935477137565613,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.42326606810092926,
          "reward_std": 0.5151561200618744,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.023842402908485383,
          "clip_ratio/low_mean": 0.00029137529782019556,
          "clip_ratio/low_min": 0.00029137529782019556,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00029137529782019556,
          "step_time": 318.04057367399855,
          "entropy_control/entropy": 0.024695198106487473,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 200.226438,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 237.342114,
          "forward_backward_time": 80.595195,
          "rollout_overhead_time": 37.115676
        },
        {
          "step": 16,
          "loss": 0.20481272041797638,
          "grad_norm": 0.193359375,
          "learning_rate": 7e-06,
          "entropy": 0.023706270498223603,
          "clip_ratio/low_mean": 0.0011569313064683229,
          "clip_ratio/low_min": 0.0011569313064683229,
          "clip_ratio/high_mean": 0.0028163990064058453,
          "clip_ratio/high_max": 0.0028163990064058453,
          "clip_ratio/region_mean": 0.003973330312874168,
          "step_time": 80.69576919999872,
          "entropy_control/entropy": 0.024632493184943767,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.598971,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.3950302004814148,
          "grad_norm": 0.2216796875,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 459122.0,
          "completions/mean_length": 423.0,
          "completions/min_length": 279.0,
          "completions/max_length": 1048.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 333.71429443359375,
          "completions/min_terminated_length": 279.0,
          "completions/max_terminated_length": 601.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.34096914529800415,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1819382905960083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.45668965578079224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.3044597804546356,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.40716272592544556,
          "reward_std": 0.45604321360588074,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.020758527258294635,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 360.7394638119995,
          "entropy_control/entropy": 0.023500461558263214,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 250.957018,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 271.182472,
          "forward_backward_time": 89.454093,
          "rollout_overhead_time": 20.225454
        },
        {
          "step": 18,
          "loss": -0.3949372470378876,
          "grad_norm": 0.314453125,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.02104511100333184,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0004385965003166348,
          "clip_ratio/high_max": 0.0004385965003166348,
          "clip_ratio/region_mean": 0.0004385965003166348,
          "step_time": 89.55805717299972,
          "entropy_control/entropy": 0.023838089914430677,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.455236,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.1308889389038086,
          "grad_norm": 0.1220703125,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 484831.0,
          "completions/mean_length": 319.125,
          "completions/min_length": 240.0,
          "completions/max_length": 450.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 319.125,
          "completions/min_terminated_length": 240.0,
          "completions/max_terminated_length": 450.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6140448451042175,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.3739270343648968e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5401251316070557,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3350076377391815,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.6895849704742432,
          "reward_std": 0.40588119626045227,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04395945614669472,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 231.9451002750011,
          "entropy_control/entropy": 0.04250542961572484,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 129.726252,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 148.674262,
          "forward_backward_time": 83.167571,
          "rollout_overhead_time": 18.94801
        },
        {
          "step": 20,
          "loss": 0.13052202761173248,
          "grad_norm": 0.0634765625,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.043755472055636346,
          "clip_ratio/low_mean": 0.001440864900359884,
          "clip_ratio/low_min": 0.001440864900359884,
          "clip_ratio/high_mean": 0.0009417087712790817,
          "clip_ratio/high_max": 0.0009417087712790817,
          "clip_ratio/region_mean": 0.0023825736716389656,
          "step_time": 83.27529721300107,
          "entropy_control/entropy": 0.04237263877625146,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.171485,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.00013608962763100863,
          "grad_norm": 0.004791259765625,
          "learning_rate": 6e-06,
          "num_tokens": 549685.0,
          "completions/mean_length": 356.375,
          "completions/min_length": 252.5,
          "completions/max_length": 846.5,
          "completions/clipped_ratio": 0.0625,
          "completions/mean_terminated_length": 315.61607360839844,
          "completions/min_terminated_length": 252.5,
          "completions/max_terminated_length": 538.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.017241379246115685,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6098255217075348,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 3.031099936379178e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.43824608623981476,
          "reward_std": 0.41505251824855804,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.02123649511486292,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.00039308174746111035,
          "clip_ratio/high_max": 0.00039308174746111035,
          "clip_ratio/region_mean": 0.00039308174746111035,
          "step_time": 495.37745529899803,
          "entropy_control/entropy": 0.021338803376996295,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 356.510989,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 399.145373,
          "forward_backward_time": 96.112842,
          "rollout_overhead_time": 42.634384
        },
        {
          "step": 22,
          "loss": -0.00013892760034650564,
          "grad_norm": 0.004180908203125,
          "learning_rate": 5.8e-06,
          "entropy": 0.022265722160227597,
          "clip_ratio/low_mean": 0.0008104770968202502,
          "clip_ratio/low_min": 0.0008104770968202502,
          "clip_ratio/high_mean": 0.0012040542787872255,
          "clip_ratio/high_max": 0.0012040542787872255,
          "clip_ratio/region_mean": 0.0020145313756074756,
          "step_time": 96.24851294900054,
          "entropy_control/entropy": 0.022364956513355468,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 96.127461,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.0001172204501926899,
          "grad_norm": 0.002716064453125,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 574957.0,
          "completions/mean_length": 269.5,
          "completions/min_length": 238.0,
          "completions/max_length": 302.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 269.5,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 302.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6153919696807861,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.2611230886250269e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8312658071517944,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.2029707932015299e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9399955868721008,
          "reward_std": 0.11538945138454437,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0361948530189693,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 204.48686326700226,
          "entropy_control/entropy": 0.03717981087405208,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 102.312062,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 121.247969,
          "forward_backward_time": 83.132366,
          "rollout_overhead_time": 18.935906
        },
        {
          "step": 24,
          "loss": 0.0001247867476195097,
          "grad_norm": 0.0019073486328125,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.036643278086557984,
          "clip_ratio/low_mean": 0.0005252101109363139,
          "clip_ratio/low_min": 0.0005252101109363139,
          "clip_ratio/high_mean": 0.0022539790661539882,
          "clip_ratio/high_max": 0.0022539790661539882,
          "clip_ratio/region_mean": 0.002779189177090302,
          "step_time": 83.22265478900044,
          "entropy_control/entropy": 0.03764647798762703,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.120204,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.0010135704651474953,
          "grad_norm": 0.0031280517578125,
          "learning_rate": 5.2e-06,
          "num_tokens": 656996.0,
          "completions/mean_length": 318.625,
          "completions/min_length": 283.0,
          "completions/max_length": 395.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 318.625,
          "completions/min_terminated_length": 283.0,
          "completions/max_terminated_length": 395.0,
          "tools/call_frequency": 4.083333333333333,
          "tools/failure_frequency": 0.01960784321029981,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6138690710067749,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.2543287274032384e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6138824025789896,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 8.413857509973847e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8305423855781555,
          "reward_std": 0.000395485646246622,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 2.0,
          "entropy": 0.08206695504486561,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 519.9165100769987,
          "entropy_control/entropy": 0.08336239241412931,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 370.307891,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 430.216418,
          "forward_backward_time": 89.601474,
          "rollout_overhead_time": 59.908527
        },
        {
          "step": 26,
          "loss": -0.0010216929949820042,
          "grad_norm": 0.00225830078125,
          "learning_rate": 5e-06,
          "entropy": 0.08219606801867485,
          "clip_ratio/low_mean": 0.0008117653196677566,
          "clip_ratio/low_min": 0.0008117653196677566,
          "clip_ratio/high_mean": 0.0006885900220368057,
          "clip_ratio/high_max": 0.0006885900220368057,
          "clip_ratio/region_mean": 0.0015003553417045623,
          "step_time": 89.6818983230014,
          "entropy_control/entropy": 0.08349240696196723,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.580678,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.06667087972164154,
          "grad_norm": 0.2333984375,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 685976.0,
          "completions/mean_length": 316.0,
          "completions/min_length": 239.0,
          "completions/max_length": 443.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 316.0,
          "completions/min_terminated_length": 239.0,
          "completions/max_terminated_length": 443.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6123619079589844,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0016762717859819531,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6825577616691589,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28837186098098755,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8130848407745361,
          "reward_std": 0.32576289772987366,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.027348426810931414,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 248.77518401499856,
          "entropy_control/entropy": 0.029340359165355667,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 150.421425,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 168.96586,
          "forward_backward_time": 79.706083,
          "rollout_overhead_time": 18.544434
        },
        {
          "step": 28,
          "loss": 0.06668534874916077,
          "grad_norm": 0.228515625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.02710607065819204,
          "clip_ratio/low_mean": 0.0003918495203834027,
          "clip_ratio/low_min": 0.0003918495203834027,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0003918495203834027,
          "step_time": 79.8105911370003,
          "entropy_control/entropy": 0.029073715001409702,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.709371,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.008208900690078735,
          "grad_norm": 0.82421875,
          "learning_rate": 4.4e-06,
          "num_tokens": 772488.0,
          "completions/mean_length": 305.5,
          "completions/min_length": 238.33333333333334,
          "completions/max_length": 490.6666666666667,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 305.5,
          "completions/min_terminated_length": 238.33333333333334,
          "completions/max_terminated_length": 490.6666666666667,
          "tools/call_frequency": 3.4583333333333335,
          "tools/failure_frequency": 0.025641026596228283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6136381228764852,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.00048718280838026357,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3888888955116272,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.06415003538131714,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.44154128432273865,
          "reward_std": 0.41859601934750873,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 1.0,
          "n_groups_refilled": 1.0,
          "n_refills": 2.0,
          "entropy": 0.053886870853602886,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 555.8580370990003,
          "entropy_control/entropy": 0.10694760189390767,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 398.705007,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 461.088238,
          "forward_backward_time": 94.668508,
          "rollout_overhead_time": 62.383231
        },
        {
          "step": 30,
          "loss": -0.00959441065788269,
          "grad_norm": 0.48828125,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.05362746957689524,
          "clip_ratio/low_mean": 0.00041666667675599456,
          "clip_ratio/low_min": 0.00041666667675599456,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00041666667675599456,
          "step_time": 94.76554830300029,
          "entropy_control/entropy": 0.10645655898498135,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 94.666383,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": -0.001027640886604786,
          "grad_norm": 0.002716064453125,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 826457.0,
          "completions/mean_length": 273.3125,
          "completions/min_length": 249.0,
          "completions/max_length": 312.5,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 273.3125,
          "completions/min_terminated_length": 249.0,
          "completions/max_terminated_length": 312.5,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8302797377109528,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0009997881716117263,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.046946406364441,
          "reward_std": 0.0009997921297326684,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.026015853974968195,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0013187458680476993,
          "clip_ratio/high_max": 0.0013187458680476993,
          "clip_ratio/region_mean": 0.0013187458680476993,
          "step_time": 263.7495171710025,
          "entropy_control/entropy": 0.025940921572166056,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 159.29829,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 191.688536,
          "forward_backward_time": 71.956727,
          "rollout_overhead_time": 32.390245
        },
        {
          "step": 32,
          "loss": -0.0010281403083354235,
          "grad_norm": 0.00183868408203125,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.02501611760817468,
          "clip_ratio/low_mean": 0.00045454545761458576,
          "clip_ratio/low_min": 0.00045454545761458576,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00045454545761458576,
          "step_time": 72.05432988400025,
          "entropy_control/entropy": 0.024931831726151377,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 71.952371,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.15645533800125122,
          "grad_norm": 0.16015625,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 903268.0,
          "completions/mean_length": 299.2916666666667,
          "completions/min_length": 244.0,
          "completions/max_length": 432.3333333333333,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 299.2916666666667,
          "completions/min_terminated_length": 244.0,
          "completions/max_terminated_length": 432.3333333333333,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6140478849411011,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.0916741833473982e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7814156214396158,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.09639175283120949,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3055555621782939,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.055555557211240135,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.8333333333333334,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.3333333333333333,
          "reward": 0.8970373074213663,
          "reward_std": 0.18561929712692896,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 2.0,
          "n_refills": 2.0,
          "entropy": 0.049092638306319714,
          "clip_ratio/low_mean": 0.0022937626927159727,
          "clip_ratio/low_min": 0.0022937626927159727,
          "clip_ratio/high_mean": 0.0005387931014411151,
          "clip_ratio/high_max": 0.0005387931014411151,
          "clip_ratio/region_mean": 0.002832555794157088,
          "step_time": 503.61257829799797,
          "entropy_control/entropy": 0.04636318241141942,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 362.20372,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 419.299724,
          "forward_backward_time": 84.208469,
          "rollout_overhead_time": 57.096004
        },
        {
          "step": 34,
          "loss": 0.156344473361969,
          "grad_norm": 0.126953125,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.04920581495389342,
          "clip_ratio/low_mean": 0.001404082984663546,
          "clip_ratio/low_min": 0.001404082984663546,
          "clip_ratio/high_mean": 0.0009505703346803784,
          "clip_ratio/high_max": 0.0009505703346803784,
          "clip_ratio/region_mean": 0.0023546533193439245,
          "step_time": 84.46763328200177,
          "entropy_control/entropy": 0.046510019564284355,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 84.364044,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.09821812808513641,
          "grad_norm": 0.283203125,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 1004209.0,
          "completions/mean_length": 345.2083333333333,
          "completions/min_length": 239.33333333333334,
          "completions/max_length": 727.6666666666666,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 345.2083333333333,
          "completions/min_terminated_length": 239.33333333333334,
          "completions/max_terminated_length": 727.6666666666666,
          "tools/call_frequency": 3.1666666666666665,
          "tools/failure_frequency": 0.012820513298114141,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.31105149785677594,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.10636565089225769,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.07638889054457347,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.13749298950036368,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.6666666666666666,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.5807350675264994,
          "reward": 0.18153761327266693,
          "reward_std": 0.22929534316062927,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 2.0,
          "n_refills": 2.0,
          "entropy": 0.04938523378223181,
          "clip_ratio/low_mean": 0.0002025931898970157,
          "clip_ratio/low_min": 0.0002025931898970157,
          "clip_ratio/high_mean": 0.00036443150020204484,
          "clip_ratio/high_max": 0.00036443150020204484,
          "clip_ratio/region_mean": 0.0005670246900990605,
          "step_time": 653.0792657429993,
          "entropy_control/entropy": 0.04729186669328827,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 501.373948,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 558.763755,
          "forward_backward_time": 94.211908,
          "rollout_overhead_time": 57.389807
        },
        {
          "step": 36,
          "loss": -0.09740924835205078,
          "grad_norm": 0.326171875,
          "learning_rate": 3e-06,
          "entropy": 0.04937561647966504,
          "clip_ratio/low_mean": 0.0010391335235908628,
          "clip_ratio/low_min": 0.0010391335235908628,
          "clip_ratio/high_mean": 0.00036443150020204484,
          "clip_ratio/high_max": 0.00036443150020204484,
          "clip_ratio/region_mean": 0.0014035650237929076,
          "step_time": 94.32943631900162,
          "entropy_control/entropy": 0.04731695139599768,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 94.226868,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.05287720263004303,
          "grad_norm": 0.310546875,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 1029472.0,
          "completions/mean_length": 273.875,
          "completions/min_length": 218.0,
          "completions/max_length": 321.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 273.875,
          "completions/min_terminated_length": 218.0,
          "completions/max_terminated_length": 321.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6158080101013184,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0009923677425831556,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6185405850410461,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0006287001306191087,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8432159423828125,
          "reward_std": 0.00982489064335823,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07710135239176452,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 201.25111297200237,
          "entropy_control/entropy": 0.07798839822258334,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 100.288398,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 119.024786,
          "forward_backward_time": 82.122121,
          "rollout_overhead_time": 18.736387
        },
        {
          "step": 38,
          "loss": 0.05305519700050354,
          "grad_norm": 0.271484375,
          "learning_rate": 2.6e-06,
          "entropy": 0.07741276384331286,
          "clip_ratio/low_mean": 0.0009779252286534756,
          "clip_ratio/low_min": 0.0009779252286534756,
          "clip_ratio/high_mean": 0.00048449612222611904,
          "clip_ratio/high_max": 0.00048449612222611904,
          "clip_ratio/region_mean": 0.0014624213508795947,
          "step_time": 82.232110277002,
          "entropy_control/entropy": 0.07839585139765556,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.124298,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.009634837508201599,
          "grad_norm": 0.32421875,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 1056904.0,
          "completions/mean_length": 334.0,
          "completions/min_length": 236.0,
          "completions/max_length": 573.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 334.0,
          "completions/min_terminated_length": 236.0,
          "completions/max_terminated_length": 573.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.29629629850387573,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6180243492126465,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0007692081853747368,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6041666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.08625821024179459,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8482327461242676,
          "reward_std": 0.004943262320011854,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.09590593725442886,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 189.21507756300343,
          "entropy_control/entropy": 0.0965752983336617,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 113.086696,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 127.815637,
          "forward_backward_time": 61.291094,
          "rollout_overhead_time": 14.728941
        },
        {
          "step": 40,
          "loss": 0.010024309158325195,
          "grad_norm": 0.287109375,
          "learning_rate": 2.2e-06,
          "entropy": 0.09636079519987106,
          "clip_ratio/low_mean": 0.0026782010099850595,
          "clip_ratio/low_min": 0.0026782010099850595,
          "clip_ratio/high_mean": 0.001626634126296267,
          "clip_ratio/high_max": 0.001626634126296267,
          "clip_ratio/region_mean": 0.004304835136281326,
          "step_time": 61.378676403999634,
          "entropy_control/entropy": 0.09697112428913258,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 61.281396,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.10985058546066284,
          "grad_norm": 0.2578125,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 1117511.0,
          "completions/mean_length": 308.4375,
          "completions/min_length": 221.5,
          "completions/max_length": 521.5,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 308.4375,
          "completions/min_terminated_length": 221.5,
          "completions/max_terminated_length": 521.5,
          "tools/call_frequency": 3.3125,
          "tools/failure_frequency": 0.07407407462596893,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6147098541259766,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0012609988334588706,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5000000149011612,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.12145226448774338,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.2958032041788101,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.09160640835762024,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.5,
          "reward": 0.4937981963157654,
          "reward_std": 0.4152926653623581,
          "frac_reward_zero_std": 0.25,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.0840687305899337,
          "clip_ratio/low_mean": 0.0004340277810115367,
          "clip_ratio/low_min": 0.0004340277810115367,
          "clip_ratio/high_mean": 0.0013882395578548312,
          "clip_ratio/high_max": 0.0013882395578548312,
          "clip_ratio/region_mean": 0.001822267338866368,
          "step_time": 400.15355072100465,
          "entropy_control/entropy": 0.09080790058207101,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 280.551752,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 316.728637,
          "forward_backward_time": 83.323281,
          "rollout_overhead_time": 36.176885
        },
        {
          "step": 42,
          "loss": -0.10962048172950745,
          "grad_norm": 0.298828125,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.08486917038680986,
          "clip_ratio/low_mean": 0.001293134322622791,
          "clip_ratio/low_min": 0.001293134322622791,
          "clip_ratio/high_mean": 0.0027587802323978394,
          "clip_ratio/high_max": 0.0027587802323978394,
          "clip_ratio/region_mean": 0.00405191455502063,
          "step_time": 83.41378324700054,
          "entropy_control/entropy": 0.09167548157514109,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.31063,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.10128452628850937,
          "grad_norm": 0.318359375,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 1175905.0,
          "completions/mean_length": 342.625,
          "completions/min_length": 244.5,
          "completions/max_length": 602.5,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 342.625,
          "completions/min_terminated_length": 244.5,
          "completions/max_terminated_length": 602.5,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.1610305979847908,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6161404550075531,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0015597647870890796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6150930523872375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0011504920076959024,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8437418043613434,
          "reward_std": 0.008564013754948974,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.05819309735670686,
          "clip_ratio/low_mean": 0.00033602150506339967,
          "clip_ratio/low_min": 0.00033602150506339967,
          "clip_ratio/high_mean": 0.0004310344811528921,
          "clip_ratio/high_max": 0.0004310344811528921,
          "clip_ratio/region_mean": 0.0007670559862162918,
          "step_time": 382.6277843600001,
          "entropy_control/entropy": 0.06136870889889593,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 268.219008,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 303.843175,
          "forward_backward_time": 78.680384,
          "rollout_overhead_time": 35.624167
        },
        {
          "step": 44,
          "loss": -0.10096702724695206,
          "grad_norm": 0.388671875,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.05854875745717436,
          "clip_ratio/low_mean": 0.0007353825203608721,
          "clip_ratio/low_min": 0.0007353825203608721,
          "clip_ratio/high_mean": 0.0015142027841648087,
          "clip_ratio/high_max": 0.0015142027841648087,
          "clip_ratio/region_mean": 0.002249585304525681,
          "step_time": 78.79109064600016,
          "entropy_control/entropy": 0.06175642943044847,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.682704,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.12669306993484497,
          "grad_norm": 0.318359375,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 1208489.0,
          "completions/mean_length": 399.0,
          "completions/min_length": 227.0,
          "completions/max_length": 809.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 399.0,
          "completions/min_terminated_length": 227.0,
          "completions/max_terminated_length": 809.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3412669599056244,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18253393471240997,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6126610040664673,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0026778648607432842,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.5415472984313965,
          "reward_std": 0.407124400138855,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.029463766026310623,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 269.876155730999,
          "entropy_control/entropy": 0.02931172858487994,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 162.155096,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 182.159972,
          "forward_backward_time": 87.617081,
          "rollout_overhead_time": 20.004876
        },
        {
          "step": 46,
          "loss": -0.12641510367393494,
          "grad_norm": 0.26953125,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.02980194427073002,
          "clip_ratio/low_mean": 0.0011407125857658684,
          "clip_ratio/low_min": 0.0011407125857658684,
          "clip_ratio/high_mean": 0.0006992460694164038,
          "clip_ratio/high_max": 0.0006992460694164038,
          "clip_ratio/region_mean": 0.0018399586551822722,
          "step_time": 87.70896454199828,
          "entropy_control/entropy": 0.029673521435050657,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.609553,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.07695724815130234,
          "grad_norm": 0.2890625,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 1237272.0,
          "completions/mean_length": 307.375,
          "completions/min_length": 238.0,
          "completions/max_length": 373.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 307.375,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 373.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6148351430892944,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0013752857921645045,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8294572234153748,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0007778152939863503,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.09622503817081451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9461045265197754,
          "reward_std": 0.11160773038864136,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05825923592783511,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 216.35137124500216,
          "entropy_control/entropy": 0.062156407920524556,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 119.592444,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 137.843519,
          "forward_backward_time": 78.410537,
          "rollout_overhead_time": 18.251074
        },
        {
          "step": 48,
          "loss": -0.07648591697216034,
          "grad_norm": 0.21875,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.05864103720523417,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0012007733748760074,
          "clip_ratio/high_max": 0.0012007733748760074,
          "clip_ratio/region_mean": 0.0012007733748760074,
          "step_time": 78.48169384499852,
          "entropy_control/entropy": 0.06260346602252487,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.390733,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": -0.03466889634728432,
          "grad_norm": 0.2470703125,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 1265889.0,
          "completions/mean_length": 282.125,
          "completions/min_length": 244.0,
          "completions/max_length": 380.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 282.125,
          "completions/min_terminated_length": 244.0,
          "completions/max_terminated_length": 380.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6141222715377808,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0015448754420503974,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8297139406204224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.3350198742045905e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.942751407623291,
          "reward_std": 0.11102522164583206,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0250300100306049,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 209.28487726499588,
          "entropy_control/entropy": 0.027301900069967827,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 112.177665,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 130.548996,
          "forward_backward_time": 78.631275,
          "rollout_overhead_time": 18.371331
        },
        {
          "step": 50,
          "loss": -0.03522661328315735,
          "grad_norm": 0.1025390625,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.02534905809443444,
          "clip_ratio/low_mean": 0.0004448398540262133,
          "clip_ratio/low_min": 0.0004448398540262133,
          "clip_ratio/high_mean": 0.0018459486309438944,
          "clip_ratio/high_max": 0.0018459486309438944,
          "clip_ratio/region_mean": 0.0022907884849701077,
          "step_time": 78.7290867219981,
          "entropy_control/entropy": 0.02766516995308736,
          "entropy_control/target": 0.038171986696735806,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.626182,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6169376468238315,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 386,
          "reward_channels": {
            "native": 0.6169376468238315,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6169388080321323,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.6169388080321323,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6169379690916243,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 423,
          "reward_channels": {
            "native": 0.6169379690916243,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6169384763792611,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 317,
          "reward_channels": {
            "native": 0.6169384763792611,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6172326900050679,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 319,
          "reward_channels": {
            "native": 0.6172326900050679,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6172314366859272,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.6172314366859272,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6172326385674898,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 252,
          "reward_channels": {
            "native": 0.6172326385674898,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6172317395034662,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 300,
          "reward_channels": {
            "native": 0.6172317395034662,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6168411288846061,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 337,
          "reward_channels": {
            "native": 0.6168411288846061,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.618344568706403,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 260,
          "reward_channels": {
            "native": 0.618344568706403,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.61834576808361,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 264,
          "reward_channels": {
            "native": 0.61834576808361,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6183447103195866,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 923,
          "reward_channels": {
            "native": 0.6183447103195866,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6174224465462672,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 381,
          "reward_channels": {
            "native": 0.6174224465462672,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6174236248934742,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 378,
          "reward_channels": {
            "native": 0.6174236248934742,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6183223973018531,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 420,
          "reward_channels": {
            "native": 0.6183223973018531,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6183236836817555,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 341,
          "reward_channels": {
            "native": 0.6183236836817555,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 266,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 232,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 235,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6212279479623682,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 419,
          "reward_channels": {
            "native": 0.6212279479623682,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6189484372109143,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 555,
          "reward_channels": {
            "native": 0.6189484372109143,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6211425116085901,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 547,
          "reward_channels": {
            "native": 0.6211425116085901,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6189508764907581,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 689,
          "reward_channels": {
            "native": 0.6189508764907581,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6189480592874964,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 571,
          "reward_channels": {
            "native": 0.6189480592874964,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6181305094102322,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 307,
          "reward_channels": {
            "native": 0.6181305094102322,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6173034664748611,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 370,
          "reward_channels": {
            "native": 0.6173034664748611,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6173049009084548,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 363,
          "reward_channels": {
            "native": 0.6173049009084548,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6181315855299198,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 357,
          "reward_channels": {
            "native": 0.6181315855299198,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6177471050538963,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6177471050538963,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.617748567686201,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.617748567686201,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.617746137146201,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.617746137146201,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6177484115209666,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6177484115209666,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 396,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8332660773209832,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 269,
          "reward_channels": {
            "native": 0.8332660773209832,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 396,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8332646993695965,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 244,
          "reward_channels": {
            "native": 0.8332646993695965,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 392,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "finalized",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8317237538429428,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8317237538429428,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.831724450047142,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.831724450047142,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8317246586644467,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8317246586644467,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789166523",
      "mode": "no-think",
      "method": "gdpo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.6487702184915543,
      "train_last10": 0.7727015286684036,
      "holdout_native": 0.6244599752567455,
      "holdout_episodes": 40,
      "holdout_successes": 36,
      "mean_step_seconds": 167.15891383194008,
      "label": "GDPO",
      "state_at_cutoff": "complete",
      "step_hours": 2.3216515809991676,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.6244599752567455,
        "efficiency": 0.4083333333333334,
        "reliability": 0.8
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "gdpo",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "bdf092940782709c651cd88ff100d0d5792e48c113165e62feb9bca73f12d1b1",
        "entropy_holdout_episodes.jsonl": "073f623323f7d481e5983b67cd8834440980d42d23c61d6434c18e9eb0f04ca6",
        "resolved_training_config.json": "33c8f43a44a7fbefbed916b1e7508136f3678340caa956196a7f542916d1496b"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.38727250695228577,
          "grad_norm": 0.1884765625,
          "learning_rate": 1e-05,
          "num_tokens": 28004.0,
          "completions/mean_length": 604.0,
          "completions/min_length": 278.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 604.0,
          "completions/min_terminated_length": 278.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5011546015739441,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.21743638813495636,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.33700284361839294,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.324005663394928,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.47949540615081787,
          "reward_std": 0.45456162095069885,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0511504570604302,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 333.16587591500013,
          "entropy_control/entropy": 0.031669787994955255,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 230.422178,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 250.553306,
          "forward_backward_time": 82.5198,
          "rollout_overhead_time": 20.131129
        },
        {
          "step": 2,
          "loss": 0.38700491189956665,
          "grad_norm": 0.1640625,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.051021368126384914,
          "clip_ratio/low_mean": 0.0006221849689609371,
          "clip_ratio/low_min": 0.0006221849689609371,
          "clip_ratio/high_mean": 0.00044169611646793783,
          "clip_ratio/high_max": 0.00044169611646793783,
          "clip_ratio/region_mean": 0.001063881085428875,
          "step_time": 82.55144402600024,
          "entropy_control/entropy": 0.03164224714123032,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.454305,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.09951995313167572,
          "grad_norm": 0.375,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 52480.0,
          "completions/mean_length": 343.5,
          "completions/min_length": 276.0,
          "completions/max_length": 476.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 343.5,
          "completions/min_terminated_length": 276.0,
          "completions/max_terminated_length": 476.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5125374794006348,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1862691342830658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.2708333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.12400397658348083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.6760792136192322,
          "reward_std": 0.2972210943698883,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07134074857458472,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 273.98975242299935,
          "entropy_control/entropy": 0.07246907367917993,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 174.958456,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 193.567245,
          "forward_backward_time": 80.309605,
          "rollout_overhead_time": 18.608788
        },
        {
          "step": 4,
          "loss": 0.09931477159261703,
          "grad_norm": 0.302734375,
          "learning_rate": 9.4e-06,
          "entropy": 0.07043077307753265,
          "clip_ratio/low_mean": 0.0006172069115564227,
          "clip_ratio/low_min": 0.0006172069115564227,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0006172069115564227,
          "step_time": 80.4203468559997,
          "entropy_control/entropy": 0.07162203048895709,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.304211,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.08481939136981964,
          "grad_norm": 0.2177734375,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 77286.0,
          "completions/mean_length": 391.75,
          "completions/min_length": 241.0,
          "completions/max_length": 541.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 391.75,
          "completions/min_terminated_length": 241.0,
          "completions/max_terminated_length": 541.0,
          "tools/call_frequency": 4.625,
          "tools/failure_frequency": 0.1621621549129486,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5576282739639282,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1546093374490738,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1781741827726364,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.724294900894165,
          "reward_std": 0.3028410077095032,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07192487828433514,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 305.7092941430003,
          "entropy_control/entropy": 0.06914766435804792,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 213.427861,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 231.105861,
          "forward_backward_time": 74.503197,
          "rollout_overhead_time": 17.678
        },
        {
          "step": 6,
          "loss": 0.08426021039485931,
          "grad_norm": 0.1337890625,
          "learning_rate": 9e-06,
          "entropy": 0.07182961772195995,
          "clip_ratio/low_mean": 0.002259135013446212,
          "clip_ratio/low_min": 0.002259135013446212,
          "clip_ratio/high_mean": 0.001180436956929043,
          "clip_ratio/high_max": 0.001180436956929043,
          "clip_ratio/region_mean": 0.0034395719703752548,
          "step_time": 74.60743086900015,
          "entropy_control/entropy": 0.0689600109913863,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 74.508268,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 8.8e-06,
          "num_tokens": 108425.0,
          "completions/mean_length": 420.875,
          "completions/min_length": 273.0,
          "completions/max_length": 730.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 420.875,
          "completions/min_terminated_length": 273.0,
          "completions/max_terminated_length": 730.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.04999999701976776,
          "reward_std": 0.0,
          "frac_reward_zero_std": 1.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02595269726589322,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 258.437109813,
          "entropy_control/entropy": 0.023225980352899613,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 161.861848,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 180.322231,
          "forward_backward_time": 78.015972,
          "rollout_overhead_time": 18.460383
        },
        {
          "step": 8,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 8.6e-06,
          "entropy": 0.02600592316593975,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 78.10814379600015,
          "entropy_control/entropy": 0.023177197137843157,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.011566,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.5584689378738403,
          "grad_norm": 0.18359375,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 137937.0,
          "completions/mean_length": 401.0,
          "completions/min_length": 283.0,
          "completions/max_length": 1078.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 401.0,
          "completions/min_terminated_length": 283.0,
          "completions/max_terminated_length": 1078.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.609546422958374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3410886824131012,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1821773648262024,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5357341766357422,
          "reward_std": 0.4022294282913208,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06978383508976549,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 331.3484992100002,
          "entropy_control/entropy": 0.054703001032588155,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 218.681912,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 239.45927,
          "forward_backward_time": 91.792435,
          "rollout_overhead_time": 20.777357
        },
        {
          "step": 10,
          "loss": -0.5580927729606628,
          "grad_norm": 0.2041015625,
          "learning_rate": 8.2e-06,
          "entropy": 0.06931559549411759,
          "clip_ratio/low_mean": 0.0016626695287413895,
          "clip_ratio/low_min": 0.0016626695287413895,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0016626695287413895,
          "step_time": 91.88299751500108,
          "entropy_control/entropy": 0.05430791565556925,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.786498,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.1361590027809143,
          "grad_norm": 0.2060546875,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 167796.0,
          "completions/mean_length": 419.375,
          "completions/min_length": 243.0,
          "completions/max_length": 728.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 419.375,
          "completions/min_terminated_length": 243.0,
          "completions/max_terminated_length": 728.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.12903225421905518,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.4959903657436371,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.21461595594882965,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6115941405296326,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.002659526187926531,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7235839366912842,
          "reward_std": 0.3029329180717468,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.03277585830073804,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 282.3033622840003,
          "entropy_control/entropy": 0.029470079562793985,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 183.821638,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 202.476008,
          "forward_backward_time": 79.726722,
          "rollout_overhead_time": 18.65437
        },
        {
          "step": 12,
          "loss": 0.13542595505714417,
          "grad_norm": 0.1689453125,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.033271659864112735,
          "clip_ratio/low_mean": 0.00034340660204179585,
          "clip_ratio/low_min": 0.00034340660204179585,
          "clip_ratio/high_mean": 0.0016978764615487307,
          "clip_ratio/high_max": 0.0016978764615487307,
          "clip_ratio/region_mean": 0.0020412830635905266,
          "step_time": 79.83501741999999,
          "entropy_control/entropy": 0.029904279471660317,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.737631,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.019682511687278748,
          "grad_norm": 0.1943359375,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 196405.0,
          "completions/mean_length": 287.125,
          "completions/min_length": 242.0,
          "completions/max_length": 355.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 287.125,
          "completions/min_terminated_length": 242.0,
          "completions/max_terminated_length": 355.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6150088310241699,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.1664858448057203e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4408377408981323,
          "reward_std": 0.41782310605049133,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05726331286132336,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 224.77536741099993,
          "entropy_control/entropy": 0.06022444738495296,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 111.617821,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 132.484956,
          "forward_backward_time": 92.193062,
          "rollout_overhead_time": 20.867135
        },
        {
          "step": 14,
          "loss": -0.019479095935821533,
          "grad_norm": 0.197265625,
          "learning_rate": 7.4e-06,
          "entropy": 0.0561726544983685,
          "clip_ratio/low_mean": 0.0007928410486783832,
          "clip_ratio/low_min": 0.0007928410486783832,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0007928410486783832,
          "step_time": 92.27920960200072,
          "entropy_control/entropy": 0.05913788510035027,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 92.184823,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": 0.12864768505096436,
          "grad_norm": 0.361328125,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 227279.0,
          "completions/mean_length": 371.75,
          "completions/min_length": 248.0,
          "completions/max_length": 651.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 371.75,
          "completions/min_terminated_length": 248.0,
          "completions/max_terminated_length": 651.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.3937557339668274,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2875114977359772,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.17396119236946106,
          "reward_std": 0.3506152331829071,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02486211364157498,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 247.53113513699964,
          "entropy_control/entropy": 0.024271421530545952,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 148.448901,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 167.003873,
          "forward_backward_time": 80.431971,
          "rollout_overhead_time": 18.554972
        },
        {
          "step": 16,
          "loss": 0.1289738416671753,
          "grad_norm": 0.1923828125,
          "learning_rate": 7e-06,
          "entropy": 0.02516411303076893,
          "clip_ratio/low_mean": 0.001231933245435357,
          "clip_ratio/low_min": 0.001231933245435357,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.001231933245435357,
          "step_time": 80.5280956029992,
          "entropy_control/entropy": 0.02442323211793303,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.434229,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.3020651340484619,
          "grad_norm": 0.2890625,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 259498.0,
          "completions/mean_length": 332.375,
          "completions/min_length": 213.0,
          "completions/max_length": 577.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 332.375,
          "completions/min_terminated_length": 213.0,
          "completions/max_terminated_length": 577.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3412719666957855,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18254393339157104,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6101261377334595,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 2.9887635264458368e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.5361157059669495,
          "reward_std": 0.4025455117225647,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.020030950428918004,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 271.0126385839999,
          "entropy_control/entropy": 0.020303291219384022,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 159.057043,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 179.745435,
          "forward_backward_time": 91.169739,
          "rollout_overhead_time": 20.688392
        },
        {
          "step": 18,
          "loss": -0.3024434447288513,
          "grad_norm": 0.1875,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.02001496049342677,
          "clip_ratio/low_mean": 0.002471604704624042,
          "clip_ratio/low_min": 0.002471604704624042,
          "clip_ratio/high_mean": 0.000216637781704776,
          "clip_ratio/high_max": 0.000216637781704776,
          "clip_ratio/region_mean": 0.002688242486328818,
          "step_time": 91.25010780400044,
          "entropy_control/entropy": 0.020251737270828584,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.154146,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.22143757343292236,
          "grad_norm": 0.31640625,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 285248.0,
          "completions/mean_length": 324.25,
          "completions/min_length": 270.0,
          "completions/max_length": 532.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 324.25,
          "completions/min_terminated_length": 270.0,
          "completions/max_terminated_length": 532.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6130162477493286,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.3635444702231325e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6844160556793213,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28961068391799927,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8132994771003723,
          "reward_std": 0.32645106315612793,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05664578056894243,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 242.5849810360005,
          "entropy_control/entropy": 0.05519685239657242,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 140.450356,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 159.358096,
          "forward_backward_time": 83.130439,
          "rollout_overhead_time": 18.90774
        },
        {
          "step": 20,
          "loss": 0.2211138904094696,
          "grad_norm": 0.2080078125,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.0572046481538564,
          "clip_ratio/low_mean": 0.000234962411923334,
          "clip_ratio/low_min": 0.000234962411923334,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.000234962411923334,
          "step_time": 83.22634736600048,
          "entropy_control/entropy": 0.05571636632192484,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.128502,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": 0.0011397600173950195,
          "grad_norm": 0.060546875,
          "learning_rate": 6e-06,
          "num_tokens": 317237.0,
          "completions/mean_length": 295.625,
          "completions/min_length": 255.0,
          "completions/max_length": 310.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 295.625,
          "completions/min_terminated_length": 255.0,
          "completions/max_terminated_length": 310.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6147057414054871,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.8970764585901634e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.4406861960887909,
          "reward_std": 0.4176611304283142,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.023078047670423985,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 199.58957194699906,
          "entropy_control/entropy": 0.022820973648635442,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 89.412534,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 109.751578,
          "forward_backward_time": 89.716512,
          "rollout_overhead_time": 20.339044
        },
        {
          "step": 22,
          "loss": 0.0010419189929962158,
          "grad_norm": 0.060546875,
          "learning_rate": 5.8e-06,
          "entropy": 0.02251318353228271,
          "clip_ratio/low_mean": 0.0004208754107821733,
          "clip_ratio/low_min": 0.0004208754107821733,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0004208754107821733,
          "step_time": 89.83986751499924,
          "entropy_control/entropy": 0.022247935782540286,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.723634,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.32887518405914307,
          "grad_norm": 0.19921875,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 343185.0,
          "completions/mean_length": 354.0,
          "completions/min_length": 238.0,
          "completions/max_length": 784.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 354.0,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 784.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6096732020378113,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.4813483630859992e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5377726554870605,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.33229130506515503,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.6862229704856873,
          "reward_std": 0.40382930636405945,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05229326005792245,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 298.13588110399996,
          "entropy_control/entropy": 0.04591277142366583,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 196.645474,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 215.577114,
          "forward_backward_time": 82.45823,
          "rollout_overhead_time": 18.93164
        },
        {
          "step": 24,
          "loss": 0.32888084650039673,
          "grad_norm": 0.1845703125,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.052134542376734316,
          "clip_ratio/low_mean": 0.0001594387722434476,
          "clip_ratio/low_min": 0.0001594387722434476,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0001594387722434476,
          "step_time": 82.56295539700022,
          "entropy_control/entropy": 0.04576141435445114,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.460355,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.037824004888534546,
          "grad_norm": 0.1376953125,
          "learning_rate": 5.2e-06,
          "num_tokens": 370439.0,
          "completions/mean_length": 312.75,
          "completions/min_length": 280.0,
          "completions/max_length": 438.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 312.75,
          "completions/min_terminated_length": 280.0,
          "completions/max_terminated_length": 438.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6147221326828003,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.3013301440878422e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6143907308578491,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.6236112969636451e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8312231302261353,
          "reward_std": 0.00017713104898575693,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06422434281557798,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 235.52427597500082,
          "entropy_control/entropy": 0.07347538832630605,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 126.756355,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 147.002874,
          "forward_backward_time": 88.422992,
          "rollout_overhead_time": 20.24652
        },
        {
          "step": 26,
          "loss": -0.03768989443778992,
          "grad_norm": 0.138671875,
          "learning_rate": 5e-06,
          "entropy": 0.06442170706577599,
          "clip_ratio/low_mean": 0.00042372880852781236,
          "clip_ratio/low_min": 0.00042372880852781236,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00042372880852781236,
          "step_time": 88.50265450799907,
          "entropy_control/entropy": 0.07369115508136113,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 88.40374,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": -0.027953416109085083,
          "grad_norm": 0.31640625,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 399193.0,
          "completions/mean_length": 287.75,
          "completions/min_length": 239.0,
          "completions/max_length": 336.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 287.75,
          "completions/min_terminated_length": 239.0,
          "completions/max_terminated_length": 336.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.614199697971344,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0012803486315533519,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.828781008720398,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.2249201972736046e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9402403235435486,
          "reward_std": 0.11264732480049133,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.027143670595251024,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 213.40258446899952,
          "entropy_control/entropy": 0.02844951199716676,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 115.68746,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 134.058492,
          "forward_backward_time": 79.244631,
          "rollout_overhead_time": 18.371032
        },
        {
          "step": 28,
          "loss": -0.028048425912857056,
          "grad_norm": 0.322265625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.02642580756219104,
          "clip_ratio/low_mean": 0.000899292150279507,
          "clip_ratio/low_min": 0.000899292150279507,
          "clip_ratio/high_mean": 0.0027432642818894237,
          "clip_ratio/high_max": 0.0027432642818894237,
          "clip_ratio/region_mean": 0.0036425564321689308,
          "step_time": 79.33389681799963,
          "entropy_control/entropy": 0.027779768298991425,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.235427,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.03274300694465637,
          "grad_norm": 0.1572265625,
          "learning_rate": 4.4e-06,
          "num_tokens": 427738.0,
          "completions/mean_length": 281.625,
          "completions/min_length": 234.0,
          "completions/max_length": 311.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 281.625,
          "completions/min_terminated_length": 234.0,
          "completions/max_terminated_length": 311.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.614264965057373,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.7530252307551564e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4404658079147339,
          "reward_std": 0.4174254834651947,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05104556283913553,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 214.97263195699907,
          "entropy_control/entropy": 0.05276931485631387,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 102.219213,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 123.103668,
          "forward_backward_time": 91.761182,
          "rollout_overhead_time": 20.884456
        },
        {
          "step": 30,
          "loss": -0.032407574355602264,
          "grad_norm": 0.1513671875,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.05202084640040994,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.000803858507424593,
          "clip_ratio/high_max": 0.000803858507424593,
          "clip_ratio/region_mean": 0.000803858507424593,
          "step_time": 91.84039551899878,
          "entropy_control/entropy": 0.05378079177366842,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.745394,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": -0.06863882392644882,
          "grad_norm": 0.443359375,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 454653.0,
          "completions/mean_length": 276.875,
          "completions/min_length": 245.0,
          "completions/max_length": 337.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 276.875,
          "completions/min_terminated_length": 245.0,
          "completions/max_terminated_length": 337.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8293575048446655,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.001310738967731595,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3541666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.058925557881593704,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0470658540725708,
          "reward_std": 0.003988455515354872,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.028321846970357,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 189.37133719200028,
          "entropy_control/entropy": 0.030888804714896197,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 107.358861,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 123.11143,
          "forward_backward_time": 66.16048,
          "rollout_overhead_time": 15.752569
        },
        {
          "step": 32,
          "loss": -0.06865701079368591,
          "grad_norm": 0.34375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.02845800167415291,
          "clip_ratio/low_mean": 0.0005081300623714924,
          "clip_ratio/low_min": 0.0005081300623714924,
          "clip_ratio/high_mean": 0.0008554160012863576,
          "clip_ratio/high_max": 0.0008554160012863576,
          "clip_ratio/region_mean": 0.00136354606365785,
          "step_time": 66.25698401200225,
          "entropy_control/entropy": 0.031066890709079847,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 66.158577,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.18087846040725708,
          "grad_norm": 0.361328125,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 480114.0,
          "completions/mean_length": 283.125,
          "completions/min_length": 237.0,
          "completions/max_length": 420.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 283.125,
          "completions/min_terminated_length": 237.0,
          "completions/max_terminated_length": 420.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6134346127510071,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.212775146086642e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6849815845489502,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28999248147010803,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8158747553825378,
          "reward_std": 0.32845762372016907,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0443328854162246,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 238.86322008099887,
          "entropy_control/entropy": 0.0440509048773095,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 136.054203,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 155.232774,
          "forward_backward_time": 83.528896,
          "rollout_overhead_time": 19.178571
        },
        {
          "step": 34,
          "loss": 0.1809271275997162,
          "grad_norm": 0.5078125,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.04486644431017339,
          "clip_ratio/low_mean": 0.0007286535401362926,
          "clip_ratio/low_min": 0.0007286535401362926,
          "clip_ratio/high_mean": 0.001054852269589901,
          "clip_ratio/high_max": 0.001054852269589901,
          "clip_ratio/region_mean": 0.0017835058097261935,
          "step_time": 83.6242890880003,
          "entropy_control/entropy": 0.04458745232396342,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.524807,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.02203717827796936,
          "grad_norm": 0.1298828125,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 516202.0,
          "completions/mean_length": 644.0,
          "completions/min_length": 252.0,
          "completions/max_length": 972.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 534.6666870117188,
          "completions/min_terminated_length": 252.0,
          "completions/max_terminated_length": 805.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.06896551698446274,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3413922190666199,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.16922716796398163,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1041666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19795581698417664,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.9258201122283936,
          "reward": 0.24660053849220276,
          "reward_std": 0.364045649766922,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.021460627438500524,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 325.1009769660004,
          "entropy_control/entropy": 0.0255883422361711,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 206.78301,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 228.799691,
          "forward_backward_time": 96.20013,
          "rollout_overhead_time": 22.016681
        },
        {
          "step": 36,
          "loss": 0.022266268730163574,
          "grad_norm": 0.14453125,
          "learning_rate": 3e-06,
          "entropy": 0.021530213358346373,
          "clip_ratio/low_mean": 0.00031407034839503467,
          "clip_ratio/low_min": 0.00031407034839503467,
          "clip_ratio/high_mean": 0.0003696877392940223,
          "clip_ratio/high_max": 0.0003696877392940223,
          "clip_ratio/region_mean": 0.000683758087689057,
          "step_time": 96.2894305789996,
          "entropy_control/entropy": 0.025569877103817792,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 96.18998,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.025003258138895035,
          "grad_norm": 0.392578125,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 541783.0,
          "completions/mean_length": 313.625,
          "completions/min_length": 249.0,
          "completions/max_length": 583.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 313.625,
          "completions/min_terminated_length": 249.0,
          "completions/max_terminated_length": 583.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6136628985404968,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.1413420679673436e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6176912784576416,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0016456745797768235,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8385937213897705,
          "reward_std": 0.010987779125571251,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06341225933283567,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 234.417130584,
          "entropy_control/entropy": 0.06292146563919619,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 130.063177,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 149.50278,
          "forward_backward_time": 84.813356,
          "rollout_overhead_time": 19.439603
        },
        {
          "step": 38,
          "loss": -0.025411099195480347,
          "grad_norm": 0.1982421875,
          "learning_rate": 2.6e-06,
          "entropy": 0.06308346474543214,
          "clip_ratio/low_mean": 0.0023818135377950966,
          "clip_ratio/low_min": 0.0023818135377950966,
          "clip_ratio/high_mean": 0.00021440823911689222,
          "clip_ratio/high_max": 0.00021440823911689222,
          "clip_ratio/region_mean": 0.002596221776911989,
          "step_time": 84.90608804000021,
          "entropy_control/entropy": 0.062550013713793,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 84.798238,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.0020994246006011963,
          "grad_norm": 0.291015625,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 569192.0,
          "completions/mean_length": 331.125,
          "completions/min_length": 237.0,
          "completions/max_length": 581.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 331.125,
          "completions/min_terminated_length": 237.0,
          "completions/max_terminated_length": 581.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.1818181872367859,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6184960007667542,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0007463989895768464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.07715168595314026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8497459888458252,
          "reward_std": 0.004449996631592512,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08218858856707811,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 171.43775163800092,
          "entropy_control/entropy": 0.07829559810819023,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 95.560153,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 110.213943,
          "forward_backward_time": 61.121981,
          "rollout_overhead_time": 14.65379
        },
        {
          "step": 40,
          "loss": -0.002934083342552185,
          "grad_norm": 0.1826171875,
          "learning_rate": 2.2e-06,
          "entropy": 0.08189644711092114,
          "clip_ratio/low_mean": 0.0011502679553814232,
          "clip_ratio/low_min": 0.0011502679553814232,
          "clip_ratio/high_mean": 0.001474380391300656,
          "clip_ratio/high_max": 0.001474380391300656,
          "clip_ratio/region_mean": 0.002624648346682079,
          "step_time": 61.22994593600197,
          "entropy_control/entropy": 0.07795156602255307,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 61.128949,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.3022345304489136,
          "grad_norm": 0.298828125,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 599963.0,
          "completions/mean_length": 365.375,
          "completions/min_length": 221.0,
          "completions/max_length": 707.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 365.375,
          "completions/min_terminated_length": 221.0,
          "completions/max_terminated_length": 707.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6151466369628906,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0030156085267663,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4327476918697357,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.21102263033390045,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.643738865852356,
          "reward_std": 0.3665681481361389,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.053320204198826104,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 299.5808600929995,
          "entropy_control/entropy": 0.05409244801659026,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 195.03342,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 214.75164,
          "forward_backward_time": 84.702605,
          "rollout_overhead_time": 19.71822
        },
        {
          "step": 42,
          "loss": -0.3024761378765106,
          "grad_norm": 0.34375,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.05294223362579942,
          "clip_ratio/low_mean": 0.0009981368493754417,
          "clip_ratio/low_min": 0.0009981368493754417,
          "clip_ratio/high_mean": 0.00101072974212002,
          "clip_ratio/high_max": 0.00101072974212002,
          "clip_ratio/region_mean": 0.0020088665914954618,
          "step_time": 84.81286498499958,
          "entropy_control/entropy": 0.05380071883417856,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 84.690381,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.2147461324930191,
          "grad_norm": 0.1884765625,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 629722.0,
          "completions/mean_length": 411.875,
          "completions/min_length": 310.0,
          "completions/max_length": 651.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 411.875,
          "completions/min_terminated_length": 310.0,
          "completions/max_terminated_length": 651.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.29629629850387573,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6168264746665955,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.00071199971716851,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6166301965713501,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.2825390740545117e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8469367027282715,
          "reward_std": 0.004546592943370342,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05981270456686616,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 250.78653634400234,
          "entropy_control/entropy": 0.05563764885202113,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 166.051046,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 182.080745,
          "forward_backward_time": 68.607153,
          "rollout_overhead_time": 16.029699
        },
        {
          "step": 44,
          "loss": -0.2156495749950409,
          "grad_norm": 0.1943359375,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.05967620899900794,
          "clip_ratio/low_mean": 0.0004032258002553135,
          "clip_ratio/low_min": 0.0004032258002553135,
          "clip_ratio/high_mean": 0.00034916200092993677,
          "clip_ratio/high_max": 0.00034916200092993677,
          "clip_ratio/region_mean": 0.0007523878011852503,
          "step_time": 68.71801683599915,
          "entropy_control/entropy": 0.055452486125669935,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 68.617309,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.2568885087966919,
          "grad_norm": 0.28515625,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 661718.0,
          "completions/mean_length": 325.5,
          "completions/min_length": 239.0,
          "completions/max_length": 564.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 325.5,
          "completions/min_terminated_length": 239.0,
          "completions/max_terminated_length": 564.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3418276309967041,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.183655247092247,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.614968478679657,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0015859014820307493,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.5450646877288818,
          "reward_std": 0.41001835465431213,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.03933716518804431,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 231.37294147800094,
          "entropy_control/entropy": 0.03803405947033658,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 123.82628,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 143.807056,
          "forward_backward_time": 87.467611,
          "rollout_overhead_time": 19.980777
        },
        {
          "step": 46,
          "loss": -0.2571696639060974,
          "grad_norm": 0.216796875,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.03926300717284903,
          "clip_ratio/low_mean": 0.00048638132284395397,
          "clip_ratio/low_min": 0.00048638132284395397,
          "clip_ratio/high_mean": 0.0015322959225159138,
          "clip_ratio/high_max": 0.0015322959225159138,
          "clip_ratio/region_mean": 0.002018677245359868,
          "step_time": 87.56447466299505,
          "entropy_control/entropy": 0.03820173846617607,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.465584,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.10692477971315384,
          "grad_norm": 0.44140625,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 690657.0,
          "completions/mean_length": 326.875,
          "completions/min_length": 269.0,
          "completions/max_length": 462.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 326.875,
          "completions/min_terminated_length": 269.0,
          "completions/max_terminated_length": 462.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6150550842285156,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0019571385346353054,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8290933966636658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0014574839733541012,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.09622503817081451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.947074294090271,
          "reward_std": 0.11023653298616409,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06172364507801831,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 232.82608543000242,
          "entropy_control/entropy": 0.0650129977897534,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 135.819103,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 154.21941,
          "forward_backward_time": 78.509995,
          "rollout_overhead_time": 18.400307
        },
        {
          "step": 48,
          "loss": -0.1069703996181488,
          "grad_norm": 0.6171875,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.06248296645935625,
          "clip_ratio/low_mean": 0.0004646840097848326,
          "clip_ratio/low_min": 0.0004646840097848326,
          "clip_ratio/high_mean": 0.0010518127819523215,
          "clip_ratio/high_max": 0.0010518127819523215,
          "clip_ratio/region_mean": 0.0015164967917371541,
          "step_time": 78.5874558070027,
          "entropy_control/entropy": 0.06575856846425679,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.485602,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": -0.005773954559117556,
          "grad_norm": 0.2275390625,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 719568.0,
          "completions/mean_length": 318.875,
          "completions/min_length": 263.0,
          "completions/max_length": 426.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 318.875,
          "completions/min_terminated_length": 263.0,
          "completions/max_terminated_length": 426.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6151204109191895,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0008677542791701853,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8296027183532715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 8.28054169232928e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9463198781013489,
          "reward_std": 0.10690131783485413,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06097144330851734,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 201.91460961000303,
          "entropy_control/entropy": 0.06719659389612954,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 114.081295,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 130.872651,
          "forward_backward_time": 70.938517,
          "rollout_overhead_time": 16.791356
        },
        {
          "step": 50,
          "loss": -0.0063142236322164536,
          "grad_norm": 0.232421875,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.06048206565901637,
          "clip_ratio/low_mean": 0.0012763740378431976,
          "clip_ratio/low_min": 0.0012763740378431976,
          "clip_ratio/high_mean": 0.0008598968852311373,
          "clip_ratio/high_max": 0.0008598968852311373,
          "clip_ratio/region_mean": 0.002136270923074335,
          "step_time": 71.03282021299674,
          "entropy_control/entropy": 0.06666982661029804,
          "entropy_control/target": 0.031669787994955255,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 70.932853,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6174455440146712,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 313,
          "reward_channels": {
            "native": 0.6174455440146712,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6174466939589095,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 224,
          "reward_channels": {
            "native": 0.6174466939589095,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6174463633467221,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 302,
          "reward_channels": {
            "native": 0.6174463633467221,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.617446325597054,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.617446325597054,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6178422403872945,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 324,
          "reward_channels": {
            "native": 0.6178422403872945,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6178429537705367,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 267,
          "reward_channels": {
            "native": 0.6178429537705367,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6178425815094428,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 298,
          "reward_channels": {
            "native": 0.6178425815094428,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6178426923321967,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 298,
          "reward_channels": {
            "native": 0.6178426923321967,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6195805269881217,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 322,
          "reward_channels": {
            "native": 0.6195805269881217,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6195813048573601,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 260,
          "reward_channels": {
            "native": 0.6195813048573601,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6195814813085709,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 275,
          "reward_channels": {
            "native": 0.6195814813085709,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6195818791400944,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 294,
          "reward_channels": {
            "native": 0.6195818791400944,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6193224283775953,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 318,
          "reward_channels": {
            "native": 0.6193224283775953,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6193222054013648,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 306,
          "reward_channels": {
            "native": 0.6193222054013648,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6199607515405053,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 268,
          "reward_channels": {
            "native": 0.6199607515405053,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6199609601615601,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 259,
          "reward_channels": {
            "native": 0.6199609601615601,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6183800407568019,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 423,
          "reward_channels": {
            "native": 0.6183800407568019,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 231,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 213,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 1176,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6189366314748597,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 696,
          "reward_channels": {
            "native": 0.6189366314748597,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6212638547151527,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 564,
          "reward_channels": {
            "native": 0.6212638547151527,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 694,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6212623637910315,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 472,
          "reward_channels": {
            "native": 0.6212623637910315,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.618051336943904,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 489,
          "reward_channels": {
            "native": 0.618051336943904,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6172147132400564,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 337,
          "reward_channels": {
            "native": 0.6172147132400564,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6180514963968338,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 318,
          "reward_channels": {
            "native": 0.6180514963968338,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6180516145176738,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 358,
          "reward_channels": {
            "native": 0.6180516145176738,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6172641546083886,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.6172641546083886,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6172660292773925,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6172660292773925,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6172664365064744,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.6172664365064744,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6172659797088377,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6172659797088377,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8331320541859051,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 340,
          "reward_channels": {
            "native": 0.8331320541859051,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8331336674653191,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 255,
          "reward_channels": {
            "native": 0.8331336674653191,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8331322965015887,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 244,
          "reward_channels": {
            "native": 0.8331322965015887,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8339143527755926,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.8339143527755926,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8314103908148568,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8314103908148568,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8325324301229429,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 317,
          "reward_channels": {
            "native": 0.8325324301229429,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8314105724246614,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8314105724246614,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8314116613495444,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8314116613495444,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789178251",
      "mode": "no-think",
      "method": "cispo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.6486137694120407,
      "train_last10": 0.7485604628920555,
      "holdout_native": 0.6190075072883925,
      "holdout_episodes": 40,
      "holdout_successes": 36,
      "mean_step_seconds": 163.6310592721801,
      "label": "CISPO",
      "state_at_cutoff": "complete",
      "step_hours": 2.272653601002501,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.6190075072883925,
        "efficiency": 0.3875,
        "reliability": 0.8
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "cispo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "cispo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "b5f6d56e778e7b7185368956126b5c73f5ea511c07051569c6e23190d76d7d3f",
        "entropy_holdout_episodes.jsonl": "0ce052904992b6a3ba17a48b7ce2966199ab0f1a18530420655f693d4d4cb8a0",
        "resolved_training_config.json": "7fab45861fcdba479397552688d9c2b9c172cf703270245f93426187a863932b"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.011696956120431423,
          "grad_norm": 0.17578125,
          "learning_rate": 1e-05,
          "num_tokens": 28015.0,
          "completions/mean_length": 605.375,
          "completions/min_length": 278.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 605.375,
          "completions/min_terminated_length": 278.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5011405944824219,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.217427060008049,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.33699893951416016,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3239978551864624,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.4794864058494568,
          "reward_std": 0.4545527994632721,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0576646868721582,
          "cispo_clip_ratio": 0.0,
          "step_time": 333.7465740409999,
          "entropy_control/entropy": 0.03520253447176984,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 230.747036,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 251.066438,
          "forward_backward_time": 82.57693,
          "rollout_overhead_time": 20.319402
        },
        {
          "step": 2,
          "loss": 0.011686078272759914,
          "grad_norm": 0.40625,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.05742358561838046,
          "cispo_clip_ratio": 0.002370120317209512,
          "step_time": 82.6701556299995,
          "entropy_control/entropy": 0.03503373747956739,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.570555,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": -0.0008278244058601558,
          "grad_norm": 0.2001953125,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 52690.0,
          "completions/mean_length": 368.375,
          "completions/min_length": 266.0,
          "completions/max_length": 541.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 368.375,
          "completions/min_terminated_length": 266.0,
          "completions/max_terminated_length": 541.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5124270915985107,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1862013339996338,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15430335700511932,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.9258201122283936,
          "reward": 0.6249271035194397,
          "reward_std": 0.37852942943573,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07531320885755122,
          "cispo_clip_ratio": 0.0,
          "step_time": 288.856015051,
          "entropy_control/entropy": 0.07677366946745573,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 194.042281,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 212.102961,
          "forward_backward_time": 76.655759,
          "rollout_overhead_time": 18.06068
        },
        {
          "step": 4,
          "loss": -0.00040398360579274595,
          "grad_norm": 0.1640625,
          "learning_rate": 9.4e-06,
          "entropy": 0.07414890546351671,
          "cispo_clip_ratio": 0.001132071134634316,
          "step_time": 76.74044861300013,
          "entropy_control/entropy": 0.07566043482977687,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 76.638718,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.009572505950927734,
          "grad_norm": 0.1552734375,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 77191.0,
          "completions/mean_length": 353.625,
          "completions/min_length": 267.0,
          "completions/max_length": 508.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 353.625,
          "completions/min_terminated_length": 267.0,
          "completions/max_terminated_length": 508.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.029411764815449715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5593600273132324,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1553049236536026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1178511381149292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7239433526992798,
          "reward_std": 0.3026188313961029,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08100612135604024,
          "cispo_clip_ratio": 0.0,
          "step_time": 244.47076902000003,
          "entropy_control/entropy": 0.07980892798655008,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 151.916381,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 169.603811,
          "forward_backward_time": 74.764521,
          "rollout_overhead_time": 17.68743
        },
        {
          "step": 6,
          "loss": 0.009266003966331482,
          "grad_norm": 0.150390625,
          "learning_rate": 9e-06,
          "entropy": 0.08065496874041855,
          "cispo_clip_ratio": 0.0017237341089639813,
          "step_time": 74.86873130699996,
          "entropy_control/entropy": 0.07953020139680542,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 74.766905,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.0002855815691873431,
          "grad_norm": 0.1044921875,
          "learning_rate": 8.8e-06,
          "num_tokens": 107672.0,
          "completions/mean_length": 338.625,
          "completions/min_length": 246.0,
          "completions/max_length": 702.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 338.625,
          "completions/min_terminated_length": 246.0,
          "completions/max_terminated_length": 702.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6818172931671143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28787821531295776,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.4221586585044861,
          "reward_std": 0.5136277675628662,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02798425412038341,
          "cispo_clip_ratio": 0.0,
          "step_time": 289.23557070100014,
          "entropy_control/entropy": 0.026933905109590678,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 193.720329,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 211.982536,
          "forward_backward_time": 77.150814,
          "rollout_overhead_time": 18.262208
        },
        {
          "step": 8,
          "loss": 0.00026433286257088184,
          "grad_norm": 0.1171875,
          "learning_rate": 8.6e-06,
          "entropy": 0.0280180653790012,
          "cispo_clip_ratio": 0.000961028621532023,
          "step_time": 77.24971800500043,
          "entropy_control/entropy": 0.02699372181632257,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 77.150474,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.00012150872498750687,
          "grad_norm": 0.00250244140625,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 136369.0,
          "completions/mean_length": 299.125,
          "completions/min_length": 248.0,
          "completions/max_length": 367.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 299.125,
          "completions/min_terminated_length": 248.0,
          "completions/max_terminated_length": 367.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.06666667014360428,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6150286793708801,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.9500225789670367e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4408476650714874,
          "reward_std": 0.41783374547958374,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.056480550207197666,
          "cispo_clip_ratio": 0.0,
          "step_time": 224.80640497600007,
          "entropy_control/entropy": 0.057690104543256626,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 111.54092,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 132.451977,
          "forward_backward_time": 92.253094,
          "rollout_overhead_time": 20.911057
        },
        {
          "step": 10,
          "loss": 0.00011808892304543406,
          "grad_norm": 0.0024566650390625,
          "learning_rate": 8.2e-06,
          "entropy": 0.05634190049022436,
          "cispo_clip_ratio": 0.000728798215277493,
          "step_time": 92.2049963720001,
          "entropy_control/entropy": 0.05751369690179424,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 92.10017,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.02621203288435936,
          "grad_norm": 0.251953125,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 165484.0,
          "completions/mean_length": 326.375,
          "completions/min_length": 257.0,
          "completions/max_length": 474.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 326.375,
          "completions/min_terminated_length": 257.0,
          "completions/max_terminated_length": 474.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6135157346725464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.000880372419487685,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6113469004631042,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0008795859757810831,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8311812877655029,
          "reward_std": 0.0048139505088329315,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04162628436461091,
          "cispo_clip_ratio": 0.0,
          "step_time": 246.77832825500036,
          "entropy_control/entropy": 0.04206859201563675,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 147.041174,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 165.856464,
          "forward_backward_time": 80.81578,
          "rollout_overhead_time": 18.81529
        },
        {
          "step": 12,
          "loss": 0.02587161585688591,
          "grad_norm": 0.2578125,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.04161024373024702,
          "cispo_clip_ratio": 0.0007668711477890611,
          "step_time": 80.91245346300002,
          "entropy_control/entropy": 0.04211295551149884,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.815475,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": -8.809672726783901e-05,
          "grad_norm": 0.001556396484375,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 194048.0,
          "completions/mean_length": 281.5,
          "completions/min_length": 248.0,
          "completions/max_length": 317.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 281.5,
          "completions/min_terminated_length": 248.0,
          "completions/max_terminated_length": 317.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.06666667014360428,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6150178909301758,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.087138230104756e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.44084227085113525,
          "reward_std": 0.41782793402671814,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05512358667328954,
          "cispo_clip_ratio": 0.0,
          "step_time": 224.1840341080001,
          "entropy_control/entropy": 0.056365220677807186,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 112.100676,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 132.685049,
          "forward_backward_time": 91.39898,
          "rollout_overhead_time": 20.584373
        },
        {
          "step": 14,
          "loss": -8.895885548554361e-05,
          "grad_norm": 0.001617431640625,
          "learning_rate": 7.4e-06,
          "entropy": 0.055093816947191954,
          "cispo_clip_ratio": 0.0,
          "step_time": 91.49797025500084,
          "entropy_control/entropy": 0.05631458216630492,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.398171,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": 0.0021335906349122524,
          "grad_norm": 0.1474609375,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 224565.0,
          "completions/mean_length": 327.125,
          "completions/min_length": 248.0,
          "completions/max_length": 466.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 327.125,
          "completions/min_terminated_length": 248.0,
          "completions/max_terminated_length": 466.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.39442187547683716,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2888437807559967,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.17429426312446594,
          "reward_std": 0.35155731439590454,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.025739588076248765,
          "cispo_clip_ratio": 0.0,
          "step_time": 202.12111372400022,
          "entropy_control/entropy": 0.025104306259425127,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 102.96408,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 121.557889,
          "forward_backward_time": 80.46287,
          "rollout_overhead_time": 18.593809
        },
        {
          "step": 16,
          "loss": 0.0022731395438313484,
          "grad_norm": 0.1328125,
          "learning_rate": 7e-06,
          "entropy": 0.025588660966604948,
          "cispo_clip_ratio": 0.0004770992381963879,
          "step_time": 80.55344558900015,
          "entropy_control/entropy": 0.02477525346074803,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.454056,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.0017667042557150126,
          "grad_norm": 0.201171875,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 256711.0,
          "completions/mean_length": 323.25,
          "completions/min_length": 250.0,
          "completions/max_length": 412.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 323.25,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 412.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.342079758644104,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1841595470905304,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6121729612350464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.1282977538940031e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.5385847091674805,
          "reward_std": 0.40461617708206177,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.037226142128929496,
          "cispo_clip_ratio": 0.0,
          "step_time": 234.3388837819998,
          "entropy_control/entropy": 0.037284315651470536,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 124.121481,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 144.41138,
          "forward_backward_time": 89.824994,
          "rollout_overhead_time": 20.289899
        },
        {
          "step": 18,
          "loss": -0.0016487125540152192,
          "grad_norm": 0.1591796875,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.036753456108272076,
          "cispo_clip_ratio": 0.0012653078301809728,
          "step_time": 89.91730763899932,
          "entropy_control/entropy": 0.03685362702606528,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.81534,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": -0.002122009638696909,
          "grad_norm": 0.150390625,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 282669.0,
          "completions/mean_length": 350.25,
          "completions/min_length": 249.0,
          "completions/max_length": 533.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 350.25,
          "completions/min_terminated_length": 249.0,
          "completions/max_terminated_length": 533.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6127638220787048,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.384231609335984e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5394852757453918,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.33426880836486816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.6886245608329773,
          "reward_std": 0.40530484914779663,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05153785599395633,
          "cispo_clip_ratio": 0.0,
          "step_time": 249.91120985899988,
          "entropy_control/entropy": 0.05100663568874365,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 147.614831,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 166.628373,
          "forward_backward_time": 83.180292,
          "rollout_overhead_time": 19.013543
        },
        {
          "step": 20,
          "loss": -0.002266033086925745,
          "grad_norm": 0.162109375,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.05132424784824252,
          "cispo_clip_ratio": 0.0017184022581204772,
          "step_time": 83.28241945400032,
          "entropy_control/entropy": 0.05073171256210918,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.181347,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.004757974296808243,
          "grad_norm": 0.1484375,
          "learning_rate": 6e-06,
          "num_tokens": 315376.0,
          "completions/mean_length": 385.375,
          "completions/min_length": 253.0,
          "completions/max_length": 755.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 385.375,
          "completions/min_terminated_length": 253.0,
          "completions/max_terminated_length": 755.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.45706266164779663,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.30470848083496094,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.3097813129425049,
          "reward_std": 0.43581223487854004,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.021211489394772798,
          "cispo_clip_ratio": 0.0,
          "step_time": 296.8628074249991,
          "entropy_control/entropy": 0.018510403000621463,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 184.644747,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 205.48839,
          "forward_backward_time": 91.273117,
          "rollout_overhead_time": 20.843643
        },
        {
          "step": 22,
          "loss": -0.00441549438983202,
          "grad_norm": 0.142578125,
          "learning_rate": 5.8e-06,
          "entropy": 0.020908002101350576,
          "cispo_clip_ratio": 0.000708465842762962,
          "step_time": 91.50680776800073,
          "entropy_control/entropy": 0.01813845544415134,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.407153,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": -0.00011591057409532368,
          "grad_norm": 0.002410888671875,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 340604.0,
          "completions/mean_length": 264.0,
          "completions/min_length": 238.0,
          "completions/max_length": 328.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 264.0,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 328.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6159777641296387,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.4424653045352898e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.831850528717041,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 9.824225344345905e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9405807852745056,
          "reward_std": 0.11538887768983841,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04471729957731441,
          "cispo_clip_ratio": 0.0,
          "step_time": 200.02424894900014,
          "entropy_control/entropy": 0.050502290532894366,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 97.802155,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 116.759051,
          "forward_backward_time": 83.170146,
          "rollout_overhead_time": 18.956896
        },
        {
          "step": 24,
          "loss": -0.00011218983854632825,
          "grad_norm": 0.0024566650390625,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.04477547685382888,
          "cispo_clip_ratio": 0.0007621950935572386,
          "step_time": 83.2709051560023,
          "entropy_control/entropy": 0.05050063915829728,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.169735,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.005243090912699699,
          "grad_norm": 0.14453125,
          "learning_rate": 5.2e-06,
          "num_tokens": 368122.0,
          "completions/mean_length": 345.75,
          "completions/min_length": 270.0,
          "completions/max_length": 537.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 345.75,
          "completions/min_terminated_length": 270.0,
          "completions/max_terminated_length": 537.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.11764705926179886,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.610882043838501,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.5732314295746619e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5216195583343506,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.18109402060508728,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.7329174280166626,
          "reward_std": 0.2760407626628876,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.051616732496768236,
          "cispo_clip_ratio": 0.0,
          "step_time": 291.8929681670015,
          "entropy_control/entropy": 0.04924595824718981,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 184.755983,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 204.647948,
          "forward_backward_time": 87.142992,
          "rollout_overhead_time": 19.891965
        },
        {
          "step": 26,
          "loss": -0.00530831515789032,
          "grad_norm": 0.14453125,
          "learning_rate": 5e-06,
          "entropy": 0.05175798456184566,
          "cispo_clip_ratio": 0.001137894083512947,
          "step_time": 87.24682994000068,
          "entropy_control/entropy": 0.04931038512443623,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.145873,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.014035399071872234,
          "grad_norm": 0.16015625,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 397130.0,
          "completions/mean_length": 319.5,
          "completions/min_length": 264.0,
          "completions/max_length": 420.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 319.5,
          "completions/min_terminated_length": 264.0,
          "completions/max_terminated_length": 420.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.612784743309021,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.0756396022770787e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8294360637664795,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0009538255399093032,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.940902054309845,
          "reward_std": 0.1191929280757904,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04855222738115117,
          "cispo_clip_ratio": 0.0,
          "step_time": 228.7263617339986,
          "entropy_control/entropy": 0.05083852091353351,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 128.891346,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 147.820181,
          "forward_backward_time": 80.808708,
          "rollout_overhead_time": 18.928835
        },
        {
          "step": 28,
          "loss": 0.01435482781380415,
          "grad_norm": 0.1806640625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.048650684067979455,
          "cispo_clip_ratio": 0.0013880650221835822,
          "step_time": 80.99899548400208,
          "entropy_control/entropy": 0.05092927913916793,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.901329,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": 3.172431024722755e-05,
          "grad_norm": 0.004302978515625,
          "learning_rate": 4.4e-06,
          "num_tokens": 425612.0,
          "completions/mean_length": 273.75,
          "completions/min_length": 251.0,
          "completions/max_length": 308.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 273.75,
          "completions/min_terminated_length": 251.0,
          "completions/max_terminated_length": 308.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.03448275849223137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6146688461303711,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 2.791042334138183e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4406677484512329,
          "reward_std": 0.41764140129089355,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05797431152313948,
          "cispo_clip_ratio": 0.0,
          "step_time": 213.71142901199983,
          "entropy_control/entropy": 0.06040345585483202,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 100.988978,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 121.743333,
          "forward_backward_time": 91.862674,
          "rollout_overhead_time": 20.754355
        },
        {
          "step": 30,
          "loss": 4.620966501533985e-05,
          "grad_norm": 0.003753662109375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.05839818390086293,
          "cispo_clip_ratio": 0.000811688310932368,
          "step_time": 91.9580735519994,
          "entropy_control/entropy": 0.060853806023601555,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.859478,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": 9.76059673121199e-05,
          "grad_norm": 0.003814697265625,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 452381.0,
          "completions/mean_length": 258.625,
          "completions/min_length": 245.0,
          "completions/max_length": 283.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 258.625,
          "completions/min_terminated_length": 245.0,
          "completions/max_terminated_length": 283.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8310146331787109,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0009932927787303925,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0476813316345215,
          "reward_std": 0.0009933008113875985,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.01822751300642267,
          "cispo_clip_ratio": 0.0,
          "step_time": 156.64428471800056,
          "entropy_control/entropy": 0.01881681340022675,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 75.723421,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 91.369715,
          "forward_backward_time": 65.168527,
          "rollout_overhead_time": 15.646294
        },
        {
          "step": 32,
          "loss": 9.737124491948634e-05,
          "grad_norm": 0.0034027099609375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.017943263635970652,
          "cispo_clip_ratio": 0.0009506253118161112,
          "step_time": 65.24445897799887,
          "entropy_control/entropy": 0.018511078376458594,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 65.149254,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.03442241623997688,
          "grad_norm": 0.2080078125,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 478063.0,
          "completions/mean_length": 310.75,
          "completions/min_length": 237.0,
          "completions/max_length": 457.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 310.75,
          "completions/min_terminated_length": 237.0,
          "completions/max_terminated_length": 457.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6115765571594238,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 6.63729224470444e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8277045488357544,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.001518408884294331,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9373488426208496,
          "reward_std": 0.1166982427239418,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05297732213512063,
          "cispo_clip_ratio": 0.0,
          "step_time": 263.94113257299887,
          "entropy_control/entropy": 0.058404171561802644,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 161.802222,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 180.909272,
          "forward_backward_time": 82.932263,
          "rollout_overhead_time": 19.10705
        },
        {
          "step": 34,
          "loss": 0.03507761284708977,
          "grad_norm": 0.3515625,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.05305020906962454,
          "cispo_clip_ratio": 0.0014242389588616788,
          "step_time": 83.02269980999881,
          "entropy_control/entropy": 0.05845580962765313,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.923604,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 511441.0,
          "completions/mean_length": 305.25,
          "completions/min_length": 217.0,
          "completions/max_length": 765.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 305.25,
          "completions/min_terminated_length": 217.0,
          "completions/max_terminated_length": 765.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.04999999701976776,
          "reward_std": 0.0,
          "frac_reward_zero_std": 1.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.023512376297730953,
          "cispo_clip_ratio": 0.0,
          "step_time": 228.89222622999932,
          "entropy_control/entropy": 0.02142604650120126,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 131.530378,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 150.163666,
          "forward_backward_time": 78.62982,
          "rollout_overhead_time": 18.633287
        },
        {
          "step": 36,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 3e-06,
          "entropy": 0.02357284730533138,
          "cispo_clip_ratio": 0.0,
          "step_time": 78.71243763899838,
          "entropy_control/entropy": 0.021456983127719577,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.621809,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.0072151473723351955,
          "grad_norm": 0.16796875,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 536898.0,
          "completions/mean_length": 298.125,
          "completions/min_length": 267.0,
          "completions/max_length": 340.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 298.125,
          "completions/min_terminated_length": 267.0,
          "completions/max_terminated_length": 340.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6144766807556152,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.1261965937592322e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6181135177612305,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0007229947950690985,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8402534127235413,
          "reward_std": 0.010251680389046669,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07811009837314487,
          "cispo_clip_ratio": 0.0,
          "step_time": 216.00361499799965,
          "entropy_control/entropy": 0.0783364595707996,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 114.402923,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 133.348161,
          "forward_backward_time": 82.557679,
          "rollout_overhead_time": 18.945238
        },
        {
          "step": 38,
          "loss": -0.007680712733417749,
          "grad_norm": 0.2001953125,
          "learning_rate": 2.6e-06,
          "entropy": 0.07916032942011952,
          "cispo_clip_ratio": 0.002167983795516193,
          "step_time": 82.63343949400041,
          "entropy_control/entropy": 0.07941339372757932,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.539924,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.012925932183861732,
          "grad_norm": 0.1611328125,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 564177.0,
          "completions/mean_length": 314.875,
          "completions/min_length": 239.0,
          "completions/max_length": 396.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 314.875,
          "completions/min_terminated_length": 239.0,
          "completions/max_terminated_length": 396.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6163939833641052,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0010152828181162477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0890870913863182,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8413939476013184,
          "reward_std": 0.005392301827669144,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.09527003375114873,
          "cispo_clip_ratio": 0.0,
          "step_time": 196.96659392399852,
          "entropy_control/entropy": 0.10476005763898033,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 112.033927,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 128.062265,
          "forward_backward_time": 68.808447,
          "rollout_overhead_time": 16.028338
        },
        {
          "step": 40,
          "loss": 0.012451570481061935,
          "grad_norm": 0.1787109375,
          "learning_rate": 2.2e-06,
          "entropy": 0.09531991847325116,
          "cispo_clip_ratio": 0.0027822678384836763,
          "step_time": 68.90001421400211,
          "entropy_control/entropy": 0.10475741206601762,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 68.804511,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.017922621220350266,
          "grad_norm": 0.390625,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 594895.0,
          "completions/mean_length": 358.75,
          "completions/min_length": 221.0,
          "completions/max_length": 673.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 358.75,
          "completions/min_terminated_length": 221.0,
          "completions/max_terminated_length": 673.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.13793103396892548,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6144246459007263,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.003429231932386756,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3419440984725952,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18388816714286804,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5438093543052673,
          "reward_std": 0.4090038239955902,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.025755474634934217,
          "cispo_clip_ratio": 0.0,
          "step_time": 286.34767421000106,
          "entropy_control/entropy": 0.02877487767957807,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 185.103894,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 204.370775,
          "forward_backward_time": 81.876508,
          "rollout_overhead_time": 19.266881
        },
        {
          "step": 42,
          "loss": 0.018034562468528748,
          "grad_norm": 0.322265625,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.025734930008184165,
          "cispo_clip_ratio": 0.0010989642469212413,
          "step_time": 81.9797362069994,
          "entropy_control/entropy": 0.02869584076593105,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 81.875234,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.00139893451705575,
          "grad_norm": 0.15234375,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 624258.0,
          "completions/mean_length": 362.375,
          "completions/min_length": 294.0,
          "completions/max_length": 537.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 362.375,
          "completions/min_terminated_length": 294.0,
          "completions/max_terminated_length": 537.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6174289584159851,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 1.7607767404115293e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6172435879707336,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0007184449350461364,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8454612493515015,
          "reward_std": 0.004553718492388725,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08050087280571461,
          "cispo_clip_ratio": 0.0,
          "step_time": 206.41304068699992,
          "entropy_control/entropy": 0.08267451758847522,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 119.114559,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 135.783519,
          "forward_backward_time": 70.529068,
          "rollout_overhead_time": 16.66896
        },
        {
          "step": 44,
          "loss": -0.001586355036124587,
          "grad_norm": 0.1533203125,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.08013763697817922,
          "cispo_clip_ratio": 0.0003324467979837209,
          "step_time": 70.62139491300059,
          "entropy_control/entropy": 0.08240471169399924,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 70.522778,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.002852009143680334,
          "grad_norm": 0.2041015625,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 657398.0,
          "completions/mean_length": 468.5,
          "completions/min_length": 245.0,
          "completions/max_length": 885.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 468.5,
          "completions/min_terminated_length": 245.0,
          "completions/max_terminated_length": 885.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.12121212482452393,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.43202048540115356,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2101791650056839,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6105724573135376,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.002514779567718506,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.6358797550201416,
          "reward_std": 0.3616826832294464,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.022907740203663707,
          "cispo_clip_ratio": 0.0,
          "step_time": 327.8458718129996,
          "entropy_control/entropy": 0.020962253492300336,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 217.615397,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 237.898564,
          "forward_backward_time": 89.847216,
          "rollout_overhead_time": 20.283167
        },
        {
          "step": 46,
          "loss": -0.0024753485340625048,
          "grad_norm": 0.1962890625,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.022694767743814737,
          "cispo_clip_ratio": 0.000433275563409552,
          "step_time": 89.92750606700247,
          "entropy_control/entropy": 0.020681492880492976,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.830958,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": 0.0020990422926843166,
          "grad_norm": 0.25,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 686504.0,
          "completions/mean_length": 347.75,
          "completions/min_length": 238.0,
          "completions/max_length": 752.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 347.75,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 752.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.610345184803009,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.3778002312392346e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6640961170196533,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.32606759667396545,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8028456568717957,
          "reward_std": 0.3517226576805115,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.029519525123760104,
          "cispo_clip_ratio": 0.0,
          "step_time": 263.3829375919995,
          "entropy_control/entropy": 0.02818433686974614,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 165.998242,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 184.559773,
          "forward_backward_time": 78.721451,
          "rollout_overhead_time": 18.561531
        },
        {
          "step": 48,
          "loss": 0.0020241173915565014,
          "grad_norm": 0.3671875,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.029669266426935792,
          "cispo_clip_ratio": 0.0015464519965462387,
          "step_time": 78.81570005100366,
          "entropy_control/entropy": 0.02836964253633302,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.712458,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.048718616366386414,
          "grad_norm": 0.302734375,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 715171.0,
          "completions/mean_length": 288.375,
          "completions/min_length": 244.0,
          "completions/max_length": 368.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 288.375,
          "completions/min_terminated_length": 244.0,
          "completions/max_terminated_length": 368.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6128493547439575,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0016547844279557467,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8294295072555542,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0009544495260342956,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9409310817718506,
          "reward_std": 0.11488863080739975,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0329138221568428,
          "cispo_clip_ratio": 0.0,
          "step_time": 222.13894051999705,
          "entropy_control/entropy": 0.038517393573914205,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 125.186869,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 143.556854,
          "forward_backward_time": 78.480469,
          "rollout_overhead_time": 18.369985
        },
        {
          "step": 50,
          "loss": 0.047011349350214005,
          "grad_norm": 0.29296875,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.032883982348721474,
          "cispo_clip_ratio": 0.0010513716551940888,
          "step_time": 78.57328194000002,
          "entropy_control/entropy": 0.03844938819068443,
          "entropy_control/target": 0.03520253447176984,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.474572,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6173862425683626,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 347,
          "reward_channels": {
            "native": 0.6173862425683626,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6173873191268587,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 224,
          "reward_channels": {
            "native": 0.6173873191268587,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6173867850859016,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.6173867850859016,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6173872431842025,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 383,
          "reward_channels": {
            "native": 0.6173872431842025,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6177540296404975,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 284,
          "reward_channels": {
            "native": 0.6177540296404975,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6177549542583101,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 277,
          "reward_channels": {
            "native": 0.6177549542583101,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.61775547305956,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 228,
          "reward_channels": {
            "native": 0.61775547305956,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6177551720649312,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 276,
          "reward_channels": {
            "native": 0.6177551720649312,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6188794449135906,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 404,
          "reward_channels": {
            "native": 0.6188794449135906,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6188811748917741,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 364,
          "reward_channels": {
            "native": 0.6188811748917741,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.619441818157028,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 451,
          "reward_channels": {
            "native": 0.619441818157028,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6188807265349773,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 348,
          "reward_channels": {
            "native": 0.6188807265349773,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6193344927032203,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 314,
          "reward_channels": {
            "native": 0.6193344927032203,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6193346308406813,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 274,
          "reward_channels": {
            "native": 0.6193346308406813,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6193351808036109,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 326,
          "reward_channels": {
            "native": 0.6193351808036109,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6193356116082984,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 341,
          "reward_channels": {
            "native": 0.6193356116082984,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 331,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 317,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 228,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6208290054711377,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 425,
          "reward_channels": {
            "native": 0.6208290054711377,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6188329288659339,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 696,
          "reward_channels": {
            "native": 0.6188329288659339,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.621148871236344,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 563,
          "reward_channels": {
            "native": 0.621148871236344,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6211485251098207,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 414,
          "reward_channels": {
            "native": 0.6211485251098207,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.621151492362887,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 429,
          "reward_channels": {
            "native": 0.621151492362887,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6179127510059353,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 485,
          "reward_channels": {
            "native": 0.6179127510059353,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6172749174515798,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 325,
          "reward_channels": {
            "native": 0.6172749174515798,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6172738687728689,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 360,
          "reward_channels": {
            "native": 0.6172738687728689,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.617274716620154,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 380,
          "reward_channels": {
            "native": 0.617274716620154,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6176202006734276,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6176202006734276,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6176201558103611,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6176201558103611,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6176187713000487,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6176187713000487,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6176187478306736,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6176187478306736,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.832945101641491,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 340,
          "reward_channels": {
            "native": 0.832945101641491,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8329464305758074,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 255,
          "reward_channels": {
            "native": 0.8329464305758074,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8329452279628777,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 244,
          "reward_channels": {
            "native": 0.8329452279628777,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.833727046042741,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.833727046042741,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 471,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8311179670606771,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 301,
          "reward_channels": {
            "native": 0.8311179670606771,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8311177434017124,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 639,
          "reward_channels": {
            "native": 0.8311177434017124,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8281855228974155,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 242,
          "reward_channels": {
            "native": 0.8281855228974155,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789190592",
      "mode": "no-think",
      "method": "adapo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.6694054710865021,
      "train_last10": 0.7525363206863404,
      "holdout_native": 0.6332133409563498,
      "holdout_episodes": 40,
      "holdout_successes": 37,
      "mean_step_seconds": 167.80051783482006,
      "label": "DAPO + ADAPO",
      "state_at_cutoff": "complete",
      "step_hours": 2.330562747705834,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.6332133409563498,
        "efficiency": 0.4291666666666667,
        "reliability": 0.85
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "adapo",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "d38b42e6891e4777a1319a4e10316751b1c7d31c9eed645f898c44db632d688a",
        "entropy_holdout_episodes.jsonl": "f0235f44cc7b00197bb33a5d2a5f4923bf3998d1625d4b771fd97b86ee131a20",
        "resolved_training_config.json": "77b2ac4e48d9a0262c1ebe23fa0f7632bd4f260e67ae5563606e24c65b6bd9d2"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.36477282643318176,
          "grad_norm": 0.1767578125,
          "learning_rate": 1e-05,
          "num_tokens": 28021.0,
          "completions/mean_length": 606.125,
          "completions/min_length": 234.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 606.125,
          "completions/min_terminated_length": 234.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5010793209075928,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.21738621592521667,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.33697786927223206,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3239557445049286,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.47944527864456177,
          "reward_std": 0.45451125502586365,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05266462272265926,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 335.65679702800014,
          "entropy_control/entropy": 0.03387283189740995,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 232.156644,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 252.486975,
          "forward_backward_time": 83.074623,
          "rollout_overhead_time": 20.330332
        },
        {
          "step": 2,
          "loss": 0.3643573820590973,
          "grad_norm": 0.10595703125,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.05260619398904964,
          "clip_ratio/low_mean": 0.0006929489754838869,
          "clip_ratio/low_min": 0.0006929489754838869,
          "clip_ratio/high_mean": 0.001230676076374948,
          "clip_ratio/high_max": 0.001230676076374948,
          "clip_ratio/region_mean": 0.001923625051858835,
          "step_time": 83.12946474800015,
          "entropy_control/entropy": 0.033707522106509624,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.29400000000000004,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.034529,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.13224834203720093,
          "grad_norm": 0.162109375,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 52556.0,
          "completions/mean_length": 350.875,
          "completions/min_length": 287.0,
          "completions/max_length": 530.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 350.875,
          "completions/min_terminated_length": 287.0,
          "completions/max_terminated_length": 530.0,
          "tools/call_frequency": 4.5,
          "tools/failure_frequency": 0.0555555559694767,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5033039450645447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2026338279247284,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15430335700511932,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.9258201122283936,
          "reward": 0.6158038973808289,
          "reward_std": 0.3955129086971283,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05990427825599909,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 258.1928802289997,
          "entropy_control/entropy": 0.05504259035661093,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.29400000000000004,
          "entropy_control/epsilon_high_next": 0.27930000000000005,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 166.934,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 184.405407,
          "forward_backward_time": 73.694281,
          "rollout_overhead_time": 17.471407
        },
        {
          "step": 4,
          "loss": 0.13253746926784515,
          "grad_norm": 0.21484375,
          "learning_rate": 9.4e-06,
          "entropy": 0.059316234197467566,
          "clip_ratio/low_mean": 0.00048386494745500386,
          "clip_ratio/low_min": 0.00048386494745500386,
          "clip_ratio/high_mean": 0.0016727226902730763,
          "clip_ratio/high_max": 0.0016727226902730763,
          "clip_ratio/region_mean": 0.00215658763772808,
          "step_time": 73.78107018699984,
          "entropy_control/entropy": 0.054435256890841485,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.27930000000000005,
          "entropy_control/epsilon_high_next": 0.26533500000000004,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.689618,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.20966660976409912,
          "grad_norm": 0.11767578125,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 77296.0,
          "completions/mean_length": 383.5,
          "completions/min_length": 288.0,
          "completions/max_length": 745.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 383.5,
          "completions/min_terminated_length": 288.0,
          "completions/max_terminated_length": 745.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.0882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5584877729415894,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15495866537094116,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1781741827726364,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7251543998718262,
          "reward_std": 0.3031940460205078,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07745937688741833,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 267.63092621400006,
          "entropy_control/entropy": 0.0678428053406856,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.26533500000000004,
          "entropy_control/epsilon_high_next": 0.25206825000000005,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 170.326377,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 188.575523,
          "forward_backward_time": 78.960512,
          "rollout_overhead_time": 18.249146
        },
        {
          "step": 6,
          "loss": 0.20974095165729523,
          "grad_norm": 0.10400390625,
          "learning_rate": 9e-06,
          "entropy": 0.0769259239314124,
          "clip_ratio/low_mean": 0.0014703015913255513,
          "clip_ratio/low_min": 0.0014703015913255513,
          "clip_ratio/high_mean": 0.0011569367488846183,
          "clip_ratio/high_max": 0.0011569367488846183,
          "clip_ratio/region_mean": 0.0026272383402101696,
          "step_time": 79.05084699599979,
          "entropy_control/entropy": 0.06738231559592471,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.25206825000000005,
          "entropy_control/epsilon_high_next": 0.23946483750000003,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.955437,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.07254389673471451,
          "grad_norm": 0.0673828125,
          "learning_rate": 8.8e-06,
          "num_tokens": 109162.0,
          "completions/mean_length": 511.75,
          "completions/min_length": 274.0,
          "completions/max_length": 989.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 511.75,
          "completions/min_terminated_length": 274.0,
          "completions/max_terminated_length": 989.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.03125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5379344820976257,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3324781060218811,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.29813387989997864,
          "reward_std": 0.459454745054245,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.022110012534540147,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 296.3191180170004,
          "entropy_control/entropy": 0.0188676192898828,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23946483750000003,
          "entropy_control/epsilon_high_next": 0.251438079375,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 193.208976,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 212.684095,
          "forward_backward_time": 83.538242,
          "rollout_overhead_time": 19.475119
        },
        {
          "step": 8,
          "loss": 0.07248738408088684,
          "grad_norm": 0.06982421875,
          "learning_rate": 8.6e-06,
          "entropy": 0.022285712941084057,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 83.63829929600024,
          "entropy_control/entropy": 0.019028148946128042,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.251438079375,
          "entropy_control/epsilon_high_next": 0.26400998334375003,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.543357,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.0005241659237071872,
          "grad_norm": 0.001129150390625,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 138440.0,
          "completions/mean_length": 371.75,
          "completions/min_length": 247.0,
          "completions/max_length": 891.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 371.75,
          "completions/min_terminated_length": 247.0,
          "completions/max_terminated_length": 891.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.03333333507180214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6098536252975464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.3639786402563914e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.43826013803482056,
          "reward_std": 0.415067583322525,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.061771039851009846,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 313.30607508199955,
          "entropy_control/entropy": 0.053312825129257745,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.26400998334375003,
          "entropy_control/epsilon_high_next": 0.2508094841765625,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 200.57349,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 221.394916,
          "forward_backward_time": 91.811735,
          "rollout_overhead_time": 20.821426
        },
        {
          "step": 10,
          "loss": 0.0005249655805528164,
          "grad_norm": 0.00107574462890625,
          "learning_rate": 8.2e-06,
          "entropy": 0.06154174020048231,
          "clip_ratio/low_mean": 0.0003571428533177823,
          "clip_ratio/low_min": 0.0003571428533177823,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0003571428533177823,
          "step_time": 91.90846876399974,
          "entropy_control/entropy": 0.05307460054667331,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2508094841765625,
          "entropy_control/epsilon_high_next": 0.23826900996773437,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.810975,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": -0.023890800774097443,
          "grad_norm": 0.16796875,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 167571.0,
          "completions/mean_length": 328.375,
          "completions/min_length": 271.0,
          "completions/max_length": 390.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 328.375,
          "completions/min_terminated_length": 271.0,
          "completions/max_terminated_length": 390.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6143152117729187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 2.0457509890547954e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6130292415618896,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0010174305643886328,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622503817081451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8324222564697266,
          "reward_std": 0.004114731214940548,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05718625441659242,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 225.00398189199996,
          "entropy_control/entropy": 0.060523702909378495,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23826900996773437,
          "entropy_control/epsilon_high_next": 0.22635555946934763,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 125.877116,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 144.59141,
          "forward_backward_time": 80.315309,
          "rollout_overhead_time": 18.714294
        },
        {
          "step": 12,
          "loss": -0.02428354322910309,
          "grad_norm": 0.1767578125,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.057206354453228414,
          "clip_ratio/low_mean": 0.001610824721865356,
          "clip_ratio/low_min": 0.001610824721865356,
          "clip_ratio/high_mean": 0.0006631299620494246,
          "clip_ratio/high_max": 0.0006631299620494246,
          "clip_ratio/region_mean": 0.0022739546839147806,
          "step_time": 80.40808471099945,
          "entropy_control/entropy": 0.060516099333305325,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22635555946934763,
          "entropy_control/epsilon_high_next": 0.21503778149588024,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.312477,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": 0.19698549807071686,
          "grad_norm": 0.255859375,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 196590.0,
          "completions/mean_length": 338.375,
          "completions/min_length": 232.0,
          "completions/max_length": 614.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 338.375,
          "completions/min_terminated_length": 232.0,
          "completions/max_terminated_length": 614.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.06451612710952759,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6121081113815308,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 2.433836016280111e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.1875,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.40813738107681274,
          "reward_std": 0.4570654034614563,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04371588374488056,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 286.83379497499936,
          "entropy_control/entropy": 0.041613701535096394,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21503778149588024,
          "entropy_control/epsilon_high_next": 0.20428589242108622,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 171.245746,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 192.416197,
          "forward_backward_time": 94.317683,
          "rollout_overhead_time": 21.170451
        },
        {
          "step": 14,
          "loss": 0.1972992867231369,
          "grad_norm": 0.20703125,
          "learning_rate": 7.4e-06,
          "entropy": 0.04388912138529122,
          "clip_ratio/low_mean": 0.0002035830548265949,
          "clip_ratio/low_min": 0.0002035830548265949,
          "clip_ratio/high_mean": 0.001406942872563377,
          "clip_ratio/high_max": 0.001406942872563377,
          "clip_ratio/region_mean": 0.001610525927389972,
          "step_time": 94.41846370099938,
          "entropy_control/entropy": 0.04183795891587543,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.20428589242108622,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 94.321893,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": 0.07450078427791595,
          "grad_norm": 0.228515625,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 227814.0,
          "completions/mean_length": 415.5,
          "completions/min_length": 250.0,
          "completions/max_length": 697.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 415.5,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 697.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.43368300795555115,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2120988667011261,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5366948246955872,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3310466706752777,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.49560555815696716,
          "reward_std": 0.48219677805900574,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.031248711398802698,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 276.89079451900034,
          "entropy_control/entropy": 0.03159708998326311,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.21000000000000002,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 176.239755,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 195.411499,
          "forward_backward_time": 81.380941,
          "rollout_overhead_time": 19.171743
        },
        {
          "step": 16,
          "loss": 0.07463432848453522,
          "grad_norm": 0.1875,
          "learning_rate": 7e-06,
          "entropy": 0.031175473937764764,
          "clip_ratio/low_mean": 0.0006493777327705175,
          "clip_ratio/low_min": 0.0006493777327705175,
          "clip_ratio/high_mean": 0.00022007041843608022,
          "clip_ratio/high_max": 0.00022007041843608022,
          "clip_ratio/region_mean": 0.0008694481512065977,
          "step_time": 81.47088516999929,
          "entropy_control/entropy": 0.03154816893489355,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21000000000000002,
          "entropy_control/epsilon_high_next": 0.22050000000000003,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 81.37529,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.06576872617006302,
          "grad_norm": 0.09912109375,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 261483.0,
          "completions/mean_length": 513.625,
          "completions/min_length": 303.0,
          "completions/max_length": 855.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 513.625,
          "completions/min_terminated_length": 303.0,
          "completions/max_terminated_length": 855.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3694382905960083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.30013903975486755,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6089195609092712,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.6016789078712463,
          "reward_std": 0.42297154664993286,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02156463696155697,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 321.19880535000084,
          "entropy_control/entropy": 0.021361945963121964,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22050000000000003,
          "entropy_control/epsilon_high_next": 0.23152500000000004,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 215.755634,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 235.728368,
          "forward_backward_time": 85.372124,
          "rollout_overhead_time": 19.972734
        },
        {
          "step": 18,
          "loss": -0.06580959260463715,
          "grad_norm": 0.08447265625,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.021777975372970104,
          "clip_ratio/low_mean": 0.00039802763785701245,
          "clip_ratio/low_min": 0.00039802763785701245,
          "clip_ratio/high_mean": 0.0006521098839584738,
          "clip_ratio/high_max": 0.0006521098839584738,
          "clip_ratio/region_mean": 0.0010501375218154863,
          "step_time": 85.4535766920003,
          "entropy_control/entropy": 0.02146843573961085,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23152500000000004,
          "entropy_control/epsilon_high_next": 0.24310125000000005,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 85.357488,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.11337518692016602,
          "grad_norm": 0.169921875,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 287111.0,
          "completions/mean_length": 309.0,
          "completions/min_length": 240.0,
          "completions/max_length": 446.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 309.0,
          "completions/min_terminated_length": 240.0,
          "completions/max_terminated_length": 446.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6139358282089233,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.2258865353942383e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6851068735122681,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2900712490081787,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8141046762466431,
          "reward_std": 0.3267587125301361,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04121474042767659,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 238.71769372400013,
          "entropy_control/entropy": 0.04206128059848401,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.24310125000000005,
          "entropy_control/epsilon_high_next": 0.23094618750000004,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 135.987196,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 155.115913,
          "forward_backward_time": 83.503476,
          "rollout_overhead_time": 19.128717
        },
        {
          "step": 20,
          "loss": 0.11320944130420685,
          "grad_norm": 0.091796875,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.041412135324208066,
          "clip_ratio/low_mean": 0.0007083512609824538,
          "clip_ratio/low_min": 0.0007083512609824538,
          "clip_ratio/high_mean": 0.0005208333604969084,
          "clip_ratio/high_max": 0.0005208333604969084,
          "clip_ratio/region_mean": 0.0012291846214793622,
          "step_time": 83.59727125000063,
          "entropy_control/entropy": 0.04231377992056128,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23094618750000004,
          "entropy_control/epsilon_high_next": 0.21939887812500003,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.498482,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": -9.638885967433453e-05,
          "grad_norm": 0.005279541015625,
          "learning_rate": 6e-06,
          "num_tokens": 319547.0,
          "completions/mean_length": 351.5,
          "completions/min_length": 250.0,
          "completions/max_length": 767.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 351.5,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 767.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.610081672668457,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 3.355729177201283e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.4383741617202759,
          "reward_std": 0.4151894748210907,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.023630270501598716,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 277.9648794860004,
          "entropy_control/entropy": 0.021144500537867875,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21939887812500003,
          "entropy_control/epsilon_high_next": 0.23036882203125003,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 168.310259,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 188.452262,
          "forward_backward_time": 89.411288,
          "rollout_overhead_time": 20.142004
        },
        {
          "step": 22,
          "loss": -8.972384966909885e-05,
          "grad_norm": 0.004852294921875,
          "learning_rate": 5.8e-06,
          "entropy": 0.023387800087220967,
          "clip_ratio/low_mean": 0.00038580247201025486,
          "clip_ratio/low_min": 0.00038580247201025486,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00038580247201025486,
          "step_time": 89.51071626000066,
          "entropy_control/entropy": 0.02090090973537038,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23036882203125003,
          "entropy_control/epsilon_high_next": 0.24188726313281253,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.412838,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.00031751743517816067,
          "grad_norm": 0.00173187255859375,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 345012.0,
          "completions/mean_length": 293.625,
          "completions/min_length": 238.0,
          "completions/max_length": 398.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 293.625,
          "completions/min_terminated_length": 238.0,
          "completions/max_terminated_length": 398.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6155115365982056,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.0739868230302818e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8313854932785034,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 7.356607625297329e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9401151537895203,
          "reward_std": 0.11538950353860855,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.053719160379841924,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 210.8280203840004,
          "entropy_control/entropy": 0.05752208560259863,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.24188726313281253,
          "entropy_control/epsilon_high_next": 0.2297928999761719,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 108.128857,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 127.256432,
          "forward_backward_time": 83.474927,
          "rollout_overhead_time": 19.127574
        },
        {
          "step": 24,
          "loss": 0.00032108870800584555,
          "grad_norm": 0.00174713134765625,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.05370692379074171,
          "clip_ratio/low_mean": 0.0004208754107821733,
          "clip_ratio/low_min": 0.0004208754107821733,
          "clip_ratio/high_mean": 0.0008392804593313485,
          "clip_ratio/high_max": 0.0008392804593313485,
          "clip_ratio/region_mean": 0.0012601558701135218,
          "step_time": 83.5664421800002,
          "entropy_control/entropy": 0.057481813048935224,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2297928999761719,
          "entropy_control/epsilon_high_next": 0.21830325497736328,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.46936,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.04335213452577591,
          "grad_norm": 0.349609375,
          "learning_rate": 5.2e-06,
          "num_tokens": 372514.0,
          "completions/mean_length": 343.75,
          "completions/min_length": 286.0,
          "completions/max_length": 441.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 343.75,
          "completions/min_terminated_length": 286.0,
          "completions/max_terminated_length": 441.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6124046444892883,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0008573840605095029,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6130148768424988,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0017914436757564545,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.833543062210083,
          "reward_std": 0.007631031796336174,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08302592276595533,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 273.73329322100017,
          "entropy_control/entropy": 0.0872263392758156,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21830325497736328,
          "entropy_control/epsilon_high_next": 0.2073880922284951,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 165.887995,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 185.942353,
          "forward_backward_time": 87.690225,
          "rollout_overhead_time": 20.054358
        },
        {
          "step": 26,
          "loss": -0.043718062341213226,
          "grad_norm": 0.26171875,
          "learning_rate": 5e-06,
          "entropy": 0.08268096530809999,
          "clip_ratio/low_mean": 0.0004139072843827307,
          "clip_ratio/low_min": 0.0004139072843827307,
          "clip_ratio/high_mean": 0.0008907363517209888,
          "clip_ratio/high_max": 0.0008907363517209888,
          "clip_ratio/region_mean": 0.0013046436361037195,
          "step_time": 87.7848287859988,
          "entropy_control/entropy": 0.08683127245284247,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2073880922284951,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.686905,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.1411801129579544,
          "grad_norm": 0.2451171875,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 401848.0,
          "completions/mean_length": 360.25,
          "completions/min_length": 266.0,
          "completions/max_length": 632.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 360.25,
          "completions/min_terminated_length": 266.0,
          "completions/max_terminated_length": 632.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5240532159805298,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1827021688222885,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8281166553497314,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0006886234623380005,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8479599356651306,
          "reward_std": 0.3370180130004883,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05922881024889648,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 239.18355853600042,
          "entropy_control/entropy": 0.05647923815915003,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 140.931675,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 159.455293,
          "forward_backward_time": 79.627677,
          "rollout_overhead_time": 18.523617
        },
        {
          "step": 28,
          "loss": 0.1409509927034378,
          "grad_norm": 0.2353515625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.05933056212961674,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0022114544408395886,
          "clip_ratio/high_max": 0.0022114544408395886,
          "clip_ratio/region_mean": 0.0022114544408395886,
          "step_time": 79.72936577699966,
          "entropy_control/entropy": 0.056529543312585945,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.630739,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": 0.023490160703659058,
          "grad_norm": 0.2265625,
          "learning_rate": 4.4e-06,
          "num_tokens": 430454.0,
          "completions/mean_length": 289.25,
          "completions/min_length": 257.0,
          "completions/max_length": 351.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 289.25,
          "completions/min_terminated_length": 257.0,
          "completions/max_terminated_length": 351.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6133197546005249,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.00048731043352745473,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.44103488326072693,
          "reward_std": 0.4180449843406677,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.051102850353345275,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 235.61832257200058,
          "entropy_control/entropy": 0.05256730198180151,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 122.613903,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 143.461784,
          "forward_backward_time": 92.058724,
          "rollout_overhead_time": 20.847881
        },
        {
          "step": 30,
          "loss": 0.024162694811820984,
          "grad_norm": 0.169921875,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.051004725391976535,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.00044642857392318547,
          "clip_ratio/high_max": 0.00044642857392318547,
          "clip_ratio/region_mean": 0.00044642857392318547,
          "step_time": 92.13939696100078,
          "entropy_control/entropy": 0.052498454667273806,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 92.044089,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": -0.05649399757385254,
          "grad_norm": 0.173828125,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 457858.0,
          "completions/mean_length": 338.0,
          "completions/min_length": 258.0,
          "completions/max_length": 508.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 338.0,
          "completions/min_terminated_length": 258.0,
          "completions/max_terminated_length": 508.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8280452489852905,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.002457990776747465,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.12598817050457,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0488786697387695,
          "reward_std": 0.008642906323075294,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04904402093961835,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 233.9038784129989,
          "entropy_control/entropy": 0.05327178426842861,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 145.819175,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 162.543491,
          "forward_backward_time": 71.259922,
          "rollout_overhead_time": 16.724316
        },
        {
          "step": 32,
          "loss": -0.056584350764751434,
          "grad_norm": 0.10498046875,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.048565386212430894,
          "clip_ratio/low_mean": 0.00048449612222611904,
          "clip_ratio/low_min": 0.00048449612222611904,
          "clip_ratio/high_mean": 0.003227768116630614,
          "clip_ratio/high_max": 0.003227768116630614,
          "clip_ratio/region_mean": 0.003712264238856733,
          "step_time": 71.2344675839995,
          "entropy_control/entropy": 0.052824577840394786,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 71.134322,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.008098140358924866,
          "grad_norm": 0.2294921875,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 483202.0,
          "completions/mean_length": 268.5,
          "completions/min_length": 237.0,
          "completions/max_length": 296.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 268.5,
          "completions/min_terminated_length": 237.0,
          "completions/max_terminated_length": 296.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.614773690700531,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.000650485570076853,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8298177123069763,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.8589261117085698e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9400039911270142,
          "reward_std": 0.11387597024440765,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.046624069567769766,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 214.05489298000066,
          "entropy_control/entropy": 0.04925495917569158,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 111.961046,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 130.917313,
          "forward_backward_time": 83.037984,
          "rollout_overhead_time": 18.956267
        },
        {
          "step": 34,
          "loss": -0.008900672197341919,
          "grad_norm": 0.126953125,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.04707741632591933,
          "clip_ratio/low_mean": 0.0025366564514115453,
          "clip_ratio/low_min": 0.0025366564514115453,
          "clip_ratio/high_mean": 0.001825004001148045,
          "clip_ratio/high_max": 0.001825004001148045,
          "clip_ratio/region_mean": 0.00436166045255959,
          "step_time": 83.12838843599911,
          "entropy_control/entropy": 0.04968981134349904,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.027857,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.09751167893409729,
          "grad_norm": 0.173828125,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 517228.0,
          "completions/mean_length": 386.25,
          "completions/min_length": 217.0,
          "completions/max_length": 788.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 386.25,
          "completions/min_terminated_length": 217.0,
          "completions/max_terminated_length": 788.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.34177881479263306,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.16994133591651917,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2314550280570984,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.9258201122283936,
          "reward": 0.24802881479263306,
          "reward_std": 0.3666780889034271,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.039438956999219954,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 268.3658710079999,
          "entropy_control/entropy": 0.03591177573991314,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 168.873184,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 187.784091,
          "forward_backward_time": 80.48275,
          "rollout_overhead_time": 18.910908
        },
        {
          "step": 36,
          "loss": 0.09772133827209473,
          "grad_norm": 0.1298828125,
          "learning_rate": 3e-06,
          "entropy": 0.0395521956961602,
          "clip_ratio/low_mean": 0.0005760368658229709,
          "clip_ratio/low_min": 0.0005760368658229709,
          "clip_ratio/high_mean": 0.0018618452886585146,
          "clip_ratio/high_max": 0.0018618452886585146,
          "clip_ratio/region_mean": 0.0024378821544814855,
          "step_time": 80.57577404099902,
          "entropy_control/entropy": 0.03620550101490342,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.48127,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.026308799162507057,
          "grad_norm": 0.171875,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 542745.0,
          "completions/mean_length": 305.625,
          "completions/min_length": 280.0,
          "completions/max_length": 351.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 305.625,
          "completions/min_terminated_length": 280.0,
          "completions/max_terminated_length": 351.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6148286461830139,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 6.068756306376599e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6183834075927734,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0005939810653217137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8405643701553345,
          "reward_std": 0.010183854959905148,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.09458077792078257,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 212.81755582700043,
          "entropy_control/entropy": 0.09513629756365732,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 111.815453,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 130.571178,
          "forward_backward_time": 82.146467,
          "rollout_overhead_time": 18.755725
        },
        {
          "step": 38,
          "loss": 0.02639860473573208,
          "grad_norm": 0.1689453125,
          "learning_rate": 2.6e-06,
          "entropy": 0.09390611946582794,
          "clip_ratio/low_mean": 0.0007961783558130264,
          "clip_ratio/low_min": 0.0007961783558130264,
          "clip_ratio/high_mean": 0.0004208754107821733,
          "clip_ratio/high_max": 0.0004208754107821733,
          "clip_ratio/region_mean": 0.0012170537665951997,
          "step_time": 82.24647135800114,
          "entropy_control/entropy": 0.09445156404649978,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.150283,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.047864072024822235,
          "grad_norm": 0.162109375,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 570339.0,
          "completions/mean_length": 354.25,
          "completions/min_length": 291.0,
          "completions/max_length": 474.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 354.25,
          "completions/min_terminated_length": 291.0,
          "completions/max_terminated_length": 474.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.1538461595773697,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6177661418914795,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0005008924636058509,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.07715168595314026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.8448494672775269,
          "reward_std": 0.004182360600680113,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1054941964102909,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 189.7340894450008,
          "entropy_control/entropy": 0.10353898318414546,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 113.950666,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 128.642906,
          "forward_backward_time": 60.994263,
          "rollout_overhead_time": 14.69224
        },
        {
          "step": 40,
          "loss": -0.047934480011463165,
          "grad_norm": 0.1220703125,
          "learning_rate": 2.2e-06,
          "entropy": 0.10487919801380485,
          "clip_ratio/low_mean": 0.0012035470572300255,
          "clip_ratio/low_min": 0.0012035470572300255,
          "clip_ratio/high_mean": 0.0006148366665001959,
          "clip_ratio/high_max": 0.0006148366665001959,
          "clip_ratio/region_mean": 0.0018183837237302214,
          "step_time": 61.10121806999996,
          "entropy_control/entropy": 0.10289937086235329,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 61.005538,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.18966902792453766,
          "grad_norm": 0.2578125,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 600809.0,
          "completions/mean_length": 327.75,
          "completions/min_length": 240.0,
          "completions/max_length": 540.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 327.75,
          "completions/min_terminated_length": 240.0,
          "completions/max_terminated_length": 540.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.04545454680919647,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6165226697921753,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0014098688261583447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.43387043476104736,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.21231532096862793,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.6470715999603271,
          "reward_std": 0.36854520440101624,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.06314902822487056,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 231.81965113800015,
          "entropy_control/entropy": 0.06058914605878699,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 129.366009,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 148.594988,
          "forward_backward_time": 83.126482,
          "rollout_overhead_time": 19.228979
        },
        {
          "step": 42,
          "loss": -0.19033004343509674,
          "grad_norm": 0.294921875,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.06259556184522808,
          "clip_ratio/low_mean": 0.0010129593429155648,
          "clip_ratio/low_min": 0.0010129593429155648,
          "clip_ratio/high_mean": 0.0037230374291539192,
          "clip_ratio/high_max": 0.0037230374291539192,
          "clip_ratio/region_mean": 0.004735996772069484,
          "step_time": 83.21017399399989,
          "entropy_control/entropy": 0.05999337480007122,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.113883,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": 0.11023291200399399,
          "grad_norm": 0.203125,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 630059.0,
          "completions/mean_length": 348.25,
          "completions/min_length": 269.0,
          "completions/max_length": 563.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 348.25,
          "completions/min_terminated_length": 269.0,
          "completions/max_terminated_length": 563.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6185731887817383,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0006251955055631697,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6169957518577576,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0007217058446258307,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8479927778244019,
          "reward_std": 0.00517592579126358,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07912383368238807,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 193.35635953499786,
          "entropy_control/entropy": 0.08572732927896128,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 103.351117,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 120.433264,
          "forward_backward_time": 72.825862,
          "rollout_overhead_time": 17.082148
        },
        {
          "step": 44,
          "loss": 0.1103602945804596,
          "grad_norm": 0.181640625,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.07986166514456272,
          "clip_ratio/low_mean": 0.0005741375352954492,
          "clip_ratio/low_min": 0.0005741375352954492,
          "clip_ratio/high_mean": 0.0021349611051846296,
          "clip_ratio/high_max": 0.0021349611051846296,
          "clip_ratio/region_mean": 0.0027090986404800788,
          "step_time": 72.92475570000352,
          "entropy_control/entropy": 0.08636384081413018,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 72.825618,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.04502106085419655,
          "grad_norm": 0.08056640625,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 663276.0,
          "completions/mean_length": 478.125,
          "completions/min_length": 229.0,
          "completions/max_length": 786.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 478.125,
          "completions/min_terminated_length": 229.0,
          "completions/max_terminated_length": 786.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.46013420820236206,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.3067595362663269,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.3154837489128113,
          "reward_std": 0.4435495436191559,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.03741473110858351,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 270.28836933099774,
          "entropy_control/entropy": 0.02958827659738704,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.21000000000000002,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 172.152937,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 190.757411,
          "forward_backward_time": 79.431845,
          "rollout_overhead_time": 18.604474
        },
        {
          "step": 46,
          "loss": -0.04480624198913574,
          "grad_norm": 0.0732421875,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.037528570857830346,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0007730482902843505,
          "clip_ratio/high_max": 0.0007730482902843505,
          "clip_ratio/region_mean": 0.0007730482902843505,
          "step_time": 79.52148914399913,
          "entropy_control/entropy": 0.02982904979034818,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21000000000000002,
          "entropy_control/epsilon_high_next": 0.22050000000000003,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.425489,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.1024111956357956,
          "grad_norm": 0.40234375,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 692331.0,
          "completions/mean_length": 341.375,
          "completions/min_length": 247.0,
          "completions/max_length": 509.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 341.375,
          "completions/min_terminated_length": 247.0,
          "completions/max_terminated_length": 509.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.1538461595773697,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6136386394500732,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0012079378357157111,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8311635255813599,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 2.2774902390665375e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9494844675064087,
          "reward_std": 0.12311206012964249,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.057108914596028626,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 231.68583597400357,
          "entropy_control/entropy": 0.056636118374944464,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22050000000000003,
          "entropy_control/epsilon_high_next": 0.20947500000000002,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 133.876683,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 152.548086,
          "forward_backward_time": 79.03583,
          "rollout_overhead_time": 18.671403
        },
        {
          "step": 48,
          "loss": -0.10202079266309738,
          "grad_norm": 0.1318359375,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.05646660481579602,
          "clip_ratio/low_mean": 0.0011839762446470559,
          "clip_ratio/low_min": 0.0011839762446470559,
          "clip_ratio/high_mean": 0.0007812500116415322,
          "clip_ratio/high_max": 0.0007812500116415322,
          "clip_ratio/region_mean": 0.001965226256288588,
          "step_time": 79.13202099600312,
          "entropy_control/entropy": 0.05593077138747248,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.20947500000000002,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.032193,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.15868572890758514,
          "grad_norm": 0.126953125,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 721455.0,
          "completions/mean_length": 345.5,
          "completions/min_length": 244.0,
          "completions/max_length": 638.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 345.5,
          "completions/min_terminated_length": 244.0,
          "completions/max_terminated_length": 638.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5223459601402283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.18156979978084564,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8282478451728821,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.0963582326439791e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8430052995681763,
          "reward_std": 0.33641016483306885,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.040065973764285445,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 244.29561989499962,
          "entropy_control/entropy": 0.043171080780193195,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 145.95122,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 164.472738,
          "forward_backward_time": 79.725501,
          "rollout_overhead_time": 18.521519
        },
        {
          "step": 50,
          "loss": 0.15876910090446472,
          "grad_norm": 0.10205078125,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.039461669395677745,
          "clip_ratio/low_mean": 0.0011050452158087865,
          "clip_ratio/low_min": 0.0011050452158087865,
          "clip_ratio/high_mean": 0.002213738247519359,
          "clip_ratio/high_max": 0.002213738247519359,
          "clip_ratio/region_mean": 0.0033187834633281454,
          "step_time": 79.96288616399761,
          "entropy_control/entropy": 0.042510970287708394,
          "entropy_control/target": 0.03387283189740995,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.865639,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6156027462878353,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 335,
          "reward_channels": {
            "native": 0.6156027462878353,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6156035667268978,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 404,
          "reward_channels": {
            "native": 0.6156035667268978,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6156035416276204,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 296,
          "reward_channels": {
            "native": 0.6156035416276204,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6164455951305502,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 304,
          "reward_channels": {
            "native": 0.6164455951305502,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6176681372465913,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 285,
          "reward_channels": {
            "native": 0.6176681372465913,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6176674544183491,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 285,
          "reward_channels": {
            "native": 0.6176674544183491,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6176677963965522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.6176677963965522,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6176667988512006,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 314,
          "reward_channels": {
            "native": 0.6176667988512006,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.618972723875739,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 308,
          "reward_channels": {
            "native": 0.618972723875739,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6189743849813638,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 271,
          "reward_channels": {
            "native": 0.6189743849813638,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6195573225663248,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 281,
          "reward_channels": {
            "native": 0.6195573225663248,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6189739411487076,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 309,
          "reward_channels": {
            "native": 0.6189739411487076,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6191941402051148,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 309,
          "reward_channels": {
            "native": 0.6191941402051148,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6191957859660329,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 316,
          "reward_channels": {
            "native": 0.6191957859660329,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6197781923240601,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 355,
          "reward_channels": {
            "native": 0.6197781923240601,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6191951726623806,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 335,
          "reward_channels": {
            "native": 0.6191951726623806,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 721,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 245,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 319,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6176130096439503,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 799,
          "reward_channels": {
            "native": 0.6176130096439503,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6190718400809729,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 696,
          "reward_channels": {
            "native": 0.6190718400809729,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6210487380906995,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 430,
          "reward_channels": {
            "native": 0.6210487380906995,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.621050450989801,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 541,
          "reward_channels": {
            "native": 0.621050450989801,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6210504229613636,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 406,
          "reward_channels": {
            "native": 0.6210504229613636,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6178382865214627,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 307,
          "reward_channels": {
            "native": 0.6178382865214627,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6171504838289823,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 368,
          "reward_channels": {
            "native": 0.6171504838289823,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6178387261247049,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 333,
          "reward_channels": {
            "native": 0.6178387261247049,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6171508614294314,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 386,
          "reward_channels": {
            "native": 0.6171508614294314,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6169854201482908,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 344,
          "reward_channels": {
            "native": 0.6169854201482908,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6161734524620605,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 387,
          "reward_channels": {
            "native": 0.6161734524620605,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6161746136479783,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 394,
          "reward_channels": {
            "native": 0.6161746136479783,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6152915263031933,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.6152915263031933,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8334000152269989,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 370,
          "reward_channels": {
            "native": 0.8334000152269989,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8323421942212565,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 244,
          "reward_channels": {
            "native": 0.8323421942212565,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8323423715483269,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 278,
          "reward_channels": {
            "native": 0.8323423715483269,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8333995836483465,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 359,
          "reward_channels": {
            "native": 0.8333995836483465,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8314558652540756,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 357,
          "reward_channels": {
            "native": 0.8314558652540756,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8314559817276693,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 353,
          "reward_channels": {
            "native": 0.8314559817276693,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8314556558584115,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 343,
          "reward_channels": {
            "native": 0.8314556558584115,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8304768381206966,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 315,
          "reward_channels": {
            "native": 0.8304768381206966,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789191744",
      "mode": "no-think",
      "method": "repo-r",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.6372784632444382,
      "train_last10": 0.7056789830327034,
      "holdout_native": 0.5724401019920183,
      "holdout_episodes": 40,
      "holdout_successes": 31,
      "mean_step_seconds": 155.50770398359992,
      "label": "DAPO + REPO-R",
      "state_at_cutoff": "complete",
      "step_hours": 2.1598292219944435,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.5724401019920183,
        "efficiency": 0.25833333333333336,
        "reliability": 0.55
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": true,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "repo_r",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 8192,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 1024
      },
      "source_sha256": {
        "metrics.jsonl": "bb5df7341e96f3d62594a192c7c782298b3ad56122a13e22516ddcf8807b4a6b",
        "entropy_holdout_episodes.jsonl": "a4b2eeb7b0a0f4a1f29e4a5da95672097552c97a1ce08d0bb3c60fa82798fb8d",
        "resolved_training_config.json": "c2e5ccd468c79aa40e12cff5deafe6e9c42c1671e5a1a9db7d24b1b50cd96acf"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.3677975833415985,
          "grad_norm": 0.1767578125,
          "learning_rate": 1e-05,
          "num_tokens": 28004.0,
          "completions/mean_length": 604.0,
          "completions/min_length": 278.0,
          "completions/max_length": 1190.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 604.0,
          "completions/min_terminated_length": 278.0,
          "completions/max_terminated_length": 1190.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5008783936500549,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2172522395849228,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.3369109332561493,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.32382190227508545,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.4793113172054291,
          "reward_std": 0.4543764293193817,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05132016638526693,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 339.4584226249999,
          "entropy_control/entropy": 0.03175173258437593,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 236.640148,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 256.70967,
          "forward_backward_time": 82.656585,
          "rollout_overhead_time": 20.069522
        },
        {
          "step": 2,
          "loss": 0.36750611662864685,
          "grad_norm": 0.111328125,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.05097695626318455,
          "clip_ratio/low_mean": 0.0005130928620928898,
          "clip_ratio/low_min": 0.0005130928620928898,
          "clip_ratio/high_mean": 0.0013298208068590611,
          "clip_ratio/high_max": 0.0013298208068590611,
          "clip_ratio/region_mean": 0.001842913668951951,
          "step_time": 82.7074748819997,
          "entropy_control/entropy": 0.03138903894117518,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.601202,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.07507390528917313,
          "grad_norm": 0.20703125,
          "learning_rate": 9.600000000000001e-06,
          "num_tokens": 52222.0,
          "completions/mean_length": 311.25,
          "completions/min_length": 264.0,
          "completions/max_length": 421.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 311.25,
          "completions/min_terminated_length": 264.0,
          "completions/max_terminated_length": 421.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.05714285746216774,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5584373474121094,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15493246912956238,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0589255690574646,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.7740623354911804,
          "reward_std": 0.15787874162197113,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.0679577412083745,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 242.9536198360006,
          "entropy_control/entropy": 0.06898518825867254,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 151.631961,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 169.045374,
          "forward_backward_time": 73.80356,
          "rollout_overhead_time": 17.413413
        },
        {
          "step": 4,
          "loss": 0.0747268944978714,
          "grad_norm": 0.2021484375,
          "learning_rate": 9.4e-06,
          "entropy": 0.06841745739802718,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0013359230069909245,
          "clip_ratio/high_max": 0.0013359230069909245,
          "clip_ratio/region_mean": 0.0013359230069909245,
          "step_time": 73.88337641899943,
          "entropy_control/entropy": 0.06941178419734081,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.785005,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.14878179132938385,
          "grad_norm": 0.18359375,
          "learning_rate": 9.200000000000002e-06,
          "num_tokens": 76528.0,
          "completions/mean_length": 329.25,
          "completions/min_length": 270.0,
          "completions/max_length": 545.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 329.25,
          "completions/min_terminated_length": 270.0,
          "completions/max_terminated_length": 545.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5586584806442261,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15502142906188965,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1178511381149292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7232417464256287,
          "reward_std": 0.30233535170555115,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.08456735871732235,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 246.90380199200013,
          "entropy_control/entropy": 0.08560581798981172,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 155.411498,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 172.942414,
          "forward_backward_time": 73.8652,
          "rollout_overhead_time": 17.530916
        },
        {
          "step": 6,
          "loss": 0.1488993614912033,
          "grad_norm": 0.1640625,
          "learning_rate": 9e-06,
          "entropy": 0.08421589806675911,
          "clip_ratio/low_mean": 0.0006574399885721505,
          "clip_ratio/low_min": 0.0006574399885721505,
          "clip_ratio/high_mean": 0.0008253562555182725,
          "clip_ratio/high_max": 0.0008253562555182725,
          "clip_ratio/region_mean": 0.001482796244090423,
          "step_time": 73.95877413000017,
          "entropy_control/entropy": 0.0853382331134385,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 73.868693,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.10186619311571121,
          "grad_norm": 0.16796875,
          "learning_rate": 8.8e-06,
          "num_tokens": 107241.0,
          "completions/mean_length": 367.625,
          "completions/min_length": 250.0,
          "completions/max_length": 733.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 367.625,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 733.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5384255051612854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3330450654029846,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.29837942123413086,
          "reward_std": 0.4599093198776245,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.026633032015524805,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 257.80528411099954,
          "entropy_control/entropy": 0.023369627524382815,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 160.900667,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 179.543973,
          "forward_backward_time": 78.175245,
          "rollout_overhead_time": 18.643306
        },
        {
          "step": 8,
          "loss": 0.10140529274940491,
          "grad_norm": 0.0966796875,
          "learning_rate": 8.6e-06,
          "entropy": 0.025937854894436896,
          "clip_ratio/low_mean": 0.001117386796977371,
          "clip_ratio/low_min": 0.001117386796977371,
          "clip_ratio/high_mean": 0.0013739545829594135,
          "clip_ratio/high_max": 0.0013739545829594135,
          "clip_ratio/region_mean": 0.0024913413799367845,
          "step_time": 78.26017540400039,
          "entropy_control/entropy": 0.022751461792769316,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.17512,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 8.400000000000001e-06,
          "num_tokens": 136500.0,
          "completions/mean_length": 369.375,
          "completions/min_length": 247.0,
          "completions/max_length": 890.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 369.375,
          "completions/min_terminated_length": 247.0,
          "completions/max_terminated_length": 890.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.06451612710952759,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.609546422958374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4381065368652344,
          "reward_std": 0.41490334272384644,
          "frac_reward_zero_std": 1.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05836797400843352,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 330.50201018900043,
          "entropy_control/entropy": 0.04967694137067181,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 217.606914,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 238.441863,
          "forward_backward_time": 91.947054,
          "rollout_overhead_time": 20.834949
        },
        {
          "step": 10,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 8.2e-06,
          "entropy": 0.0587232259567827,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 92.07023043800154,
          "entropy_control/entropy": 0.05004108105767101,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.951372,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 11,
          "loss": -0.00042744772508740425,
          "grad_norm": 0.002349853515625,
          "learning_rate": 8.000000000000001e-06,
          "num_tokens": 165380.0,
          "completions/mean_length": 297.0,
          "completions/min_length": 256.0,
          "completions/max_length": 382.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 297.0,
          "completions/min_terminated_length": 256.0,
          "completions/max_terminated_length": 382.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6152178645133972,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 2.2717633783031488e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6130492687225342,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.3786594763587345e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8308002352714539,
          "reward_std": 0.001159140607342124,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02870261576026678,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 209.886425788,
          "entropy_control/entropy": 0.02939591253793728,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 110.477852,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 129.265464,
          "forward_backward_time": 80.514475,
          "rollout_overhead_time": 18.787612
        },
        {
          "step": 12,
          "loss": -0.00042418157681822777,
          "grad_norm": 0.002410888671875,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.02758015098515898,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 80.60424775000092,
          "entropy_control/entropy": 0.028318129083174517,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.502626,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.0006278872024267912,
          "grad_norm": 0.0030364990234375,
          "learning_rate": 7.600000000000001e-06,
          "num_tokens": 194020.0,
          "completions/mean_length": 291.0,
          "completions/min_length": 254.0,
          "completions/max_length": 358.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 291.0,
          "completions/min_terminated_length": 254.0,
          "completions/max_terminated_length": 358.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6147884130477905,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 2.126363142451737e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4407275319099426,
          "reward_std": 0.4177052974700928,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05903345951810479,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 221.18660950699996,
          "entropy_control/entropy": 0.06082484628909123,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 108.3372,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 129.130762,
          "forward_backward_time": 91.944136,
          "rollout_overhead_time": 20.793562
        },
        {
          "step": 14,
          "loss": -0.0006222964730113745,
          "grad_norm": 0.0029144287109375,
          "learning_rate": 7.4e-06,
          "entropy": 0.05921871028840542,
          "clip_ratio/low_mean": 0.001252432237379253,
          "clip_ratio/low_min": 0.001252432237379253,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.001252432237379253,
          "step_time": 92.04747875399926,
          "entropy_control/entropy": 0.060986647525984344,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.938908,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 15,
          "loss": 0.09406601637601852,
          "grad_norm": 0.14453125,
          "learning_rate": 7.2000000000000005e-06,
          "num_tokens": 224524.0,
          "completions/mean_length": 325.5,
          "completions/min_length": 246.0,
          "completions/max_length": 443.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 325.5,
          "completions/min_terminated_length": 246.0,
          "completions/max_terminated_length": 443.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.39422667026519775,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2884533107280731,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.17419666051864624,
          "reward_std": 0.35128122568130493,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02758158289361745,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 215.4094084999997,
          "entropy_control/entropy": 0.026020437417879422,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 116.292477,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 134.882183,
          "forward_backward_time": 80.414608,
          "rollout_overhead_time": 18.589707
        },
        {
          "step": 16,
          "loss": 0.09405205398797989,
          "grad_norm": 0.1181640625,
          "learning_rate": 7e-06,
          "entropy": 0.02729236683808267,
          "clip_ratio/low_mean": 0.0005840994126629084,
          "clip_ratio/low_min": 0.0005840994126629084,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0005840994126629084,
          "step_time": 80.51190537299908,
          "entropy_control/entropy": 0.025735738148851568,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.402759,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 17,
          "loss": -6.423094600904733e-05,
          "grad_norm": 0.00116729736328125,
          "learning_rate": 6.800000000000001e-06,
          "num_tokens": 256259.0,
          "completions/mean_length": 271.875,
          "completions/min_length": 213.0,
          "completions/max_length": 306.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 271.875,
          "completions/min_terminated_length": 213.0,
          "completions/max_terminated_length": 306.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6142328977584839,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 2.5271713184338296e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.4404497742652893,
          "reward_std": 0.4174083471298218,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.01683327781211119,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 198.84701016199915,
          "entropy_control/entropy": 0.01737684080312262,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 88.976497,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 109.227697,
          "forward_backward_time": 89.507457,
          "rollout_overhead_time": 20.2512
        },
        {
          "step": 18,
          "loss": -5.6417673476971686e-05,
          "grad_norm": 0.00135040283203125,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.016886168712517247,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 89.61900508899998,
          "entropy_control/entropy": 0.017444355780958987,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 89.502407,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.15298286080360413,
          "grad_norm": 0.193359375,
          "learning_rate": 6.4000000000000006e-06,
          "num_tokens": 281939.0,
          "completions/mean_length": 315.5,
          "completions/min_length": 253.0,
          "completions/max_length": 521.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 315.5,
          "completions/min_terminated_length": 253.0,
          "completions/max_terminated_length": 521.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6129077672958374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.0220068134003668e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.684334397315979,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28955626487731934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8132044076919556,
          "reward_std": 0.32641470432281494,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.044751655659638345,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 249.52503382100076,
          "entropy_control/entropy": 0.045542472828241955,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 147.188196,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 166.216887,
          "forward_backward_time": 83.19432,
          "rollout_overhead_time": 19.028691
        },
        {
          "step": 20,
          "loss": 0.15252260863780975,
          "grad_norm": 0.12060546875,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.044047977426089346,
          "clip_ratio/low_mean": 0.000973917602095753,
          "clip_ratio/low_min": 0.000973917602095753,
          "clip_ratio/high_mean": 0.0004789271915797144,
          "clip_ratio/high_max": 0.0004789271915797144,
          "clip_ratio/region_mean": 0.0014528447936754674,
          "step_time": 83.31169498500003,
          "entropy_control/entropy": 0.044899696954788675,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.196748,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 21,
          "loss": 0.0008379751816391945,
          "grad_norm": 0.00372314453125,
          "learning_rate": 6e-06,
          "num_tokens": 314181.0,
          "completions/mean_length": 327.25,
          "completions/min_length": 256.0,
          "completions/max_length": 512.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 327.25,
          "completions/min_terminated_length": 256.0,
          "completions/max_terminated_length": 512.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6129704117774963,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 2.9602974791487213e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.43981853127479553,
          "reward_std": 0.4167335629463196,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02073569670028519,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 232.0127544120005,
          "entropy_control/entropy": 0.02058484643387447,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 119.038225,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 140.031491,
          "forward_backward_time": 91.865806,
          "rollout_overhead_time": 20.993266
        },
        {
          "step": 22,
          "loss": 0.0008416565251536667,
          "grad_norm": 0.002777099609375,
          "learning_rate": 5.8e-06,
          "entropy": 0.020891853877401445,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 91.99613114599924,
          "entropy_control/entropy": 0.020715168776132165,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.877733,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 23,
          "loss": 5.250214599072933e-06,
          "grad_norm": 0.00164031982421875,
          "learning_rate": 5.600000000000001e-06,
          "num_tokens": 339658.0,
          "completions/mean_length": 295.125,
          "completions/min_length": 258.0,
          "completions/max_length": 328.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 295.125,
          "completions/min_terminated_length": 258.0,
          "completions/max_terminated_length": 328.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.61496502161026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.3495769053406548e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8308384418487549,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 6.769786295990343e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9395684003829956,
          "reward_std": 0.11538917571306229,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04453222232405096,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 216.0728001890011,
          "entropy_control/entropy": 0.04541582179304047,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 113.720911,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 132.717597,
          "forward_backward_time": 83.234269,
          "rollout_overhead_time": 18.996686
        },
        {
          "step": 24,
          "loss": 6.836606189608574e-06,
          "grad_norm": 0.00170135498046875,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.0446750185219571,
          "clip_ratio/low_mean": 0.00046641789958812296,
          "clip_ratio/low_min": 0.00046641789958812296,
          "clip_ratio/high_mean": 0.0008405257540289313,
          "clip_ratio/high_max": 0.0008405257540289313,
          "clip_ratio/region_mean": 0.0013069436536170542,
          "step_time": 83.3361953620024,
          "entropy_control/entropy": 0.04554446372616983,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.22157,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.00014857194037176669,
          "grad_norm": 0.00225830078125,
          "learning_rate": 5.2e-06,
          "num_tokens": 366783.0,
          "completions/mean_length": 296.625,
          "completions/min_length": 240.0,
          "completions/max_length": 312.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 296.625,
          "completions/min_terminated_length": 240.0,
          "completions/max_terminated_length": 312.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6142096519470215,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.2474328059397521e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6138775944709778,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.644627445784863e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.830710232257843,
          "reward_std": 0.00017749733524397016,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.04687308776192367,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 230.28595424500054,
          "entropy_control/entropy": 0.047156096221906994,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 123.061737,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 142.856217,
          "forward_backward_time": 87.308331,
          "rollout_overhead_time": 19.794481
        },
        {
          "step": 26,
          "loss": -0.0001543594989925623,
          "grad_norm": 0.00157928466796875,
          "learning_rate": 5e-06,
          "entropy": 0.047321059624664485,
          "clip_ratio/low_mean": 0.0004071661096531898,
          "clip_ratio/low_min": 0.0004071661096531898,
          "clip_ratio/high_mean": 0.0008025702845770866,
          "clip_ratio/high_max": 0.0008025702845770866,
          "clip_ratio/region_mean": 0.0012097363942302763,
          "step_time": 87.43614393299958,
          "entropy_control/entropy": 0.04758420987263972,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 87.320586,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.07329875975847244,
          "grad_norm": 0.15234375,
          "learning_rate": 4.800000000000001e-06,
          "num_tokens": 395905.0,
          "completions/mean_length": 333.75,
          "completions/min_length": 303.0,
          "completions/max_length": 438.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 333.75,
          "completions/min_terminated_length": 303.0,
          "completions/max_terminated_length": 438.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.612331748008728,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 4.526291661477444e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6831650733947754,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2887767553329468,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8123317360877991,
          "reward_std": 0.32592231035232544,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.023141608107835054,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 235.536094047,
          "entropy_control/entropy": 0.022956123942045287,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 136.594134,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 155.359358,
          "forward_backward_time": 80.057082,
          "rollout_overhead_time": 18.765225
        },
        {
          "step": 28,
          "loss": 0.07343291491270065,
          "grad_norm": 0.1943359375,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.02303338935598731,
          "clip_ratio/low_mean": 0.0002853881160262972,
          "clip_ratio/low_min": 0.0002853881160262972,
          "clip_ratio/high_mean": 0.00040983606595546007,
          "clip_ratio/high_max": 0.00040983606595546007,
          "clip_ratio/region_mean": 0.0006952241819817573,
          "step_time": 80.15440302699972,
          "entropy_control/entropy": 0.022861084086465176,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 80.04201,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.0004251918289810419,
          "grad_norm": 0.0012054443359375,
          "learning_rate": 4.4e-06,
          "num_tokens": 424415.0,
          "completions/mean_length": 277.25,
          "completions/min_length": 236.0,
          "completions/max_length": 311.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 277.25,
          "completions/min_terminated_length": 236.0,
          "completions/max_terminated_length": 311.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6138591170310974,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 9.524317761133716e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.44026288390159607,
          "reward_std": 0.41720855236053467,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.05170884821563959,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 225.034533508001,
          "entropy_control/entropy": 0.05304620545559113,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 112.046297,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 133.043454,
          "forward_backward_time": 91.872883,
          "rollout_overhead_time": 20.997157
        },
        {
          "step": 30,
          "loss": -0.0004242782015353441,
          "grad_norm": 0.00106048583984375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.05198635067790747,
          "clip_ratio/low_mean": 0.0005296610179357231,
          "clip_ratio/low_min": 0.0005296610179357231,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0005296610179357231,
          "step_time": 91.9762094639982,
          "entropy_control/entropy": 0.0533380043688536,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 91.8649,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.0007572928443551064,
          "grad_norm": 0.0031890869140625,
          "learning_rate": 4.000000000000001e-06,
          "num_tokens": 451380.0,
          "completions/mean_length": 283.125,
          "completions/min_length": 257.0,
          "completions/max_length": 319.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 283.125,
          "completions/min_terminated_length": 257.0,
          "completions/max_terminated_length": 319.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8303067684173584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.000992488581687212,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.046973466873169,
          "reward_std": 0.000992488581687212,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.01986620854586363,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 169.8875314800007,
          "entropy_control/entropy": 0.019852706463515807,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 87.769804,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 103.579312,
          "forward_backward_time": 66.214919,
          "rollout_overhead_time": 15.809508
        },
        {
          "step": 32,
          "loss": 0.0007597359362989664,
          "grad_norm": 0.0036468505859375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.020172513090074062,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.00044802867341786623,
          "clip_ratio/high_max": 0.00044802867341786623,
          "clip_ratio/region_mean": 0.00044802867341786623,
          "step_time": 66.26559639399966,
          "entropy_control/entropy": 0.0201377382248116,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 66.17027,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.00016835879068821669,
          "grad_norm": 0.0024566650390625,
          "learning_rate": 3.6000000000000003e-06,
          "num_tokens": 476805.0,
          "completions/mean_length": 278.625,
          "completions/min_length": 250.0,
          "completions/max_length": 316.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 278.625,
          "completions/min_terminated_length": 250.0,
          "completions/max_terminated_length": 316.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6154767870903015,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.2811532315026852e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8308459520339966,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 9.914219845086336e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9398280382156372,
          "reward_std": 0.11511971056461334,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.040752315893769264,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 207.3118805610011,
          "entropy_control/entropy": 0.04239122198632703,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 104.487355,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 123.615215,
          "forward_backward_time": 83.604137,
          "rollout_overhead_time": 19.127861
        },
        {
          "step": 34,
          "loss": -0.00016834831330925226,
          "grad_norm": 0.002471923828125,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.0409962716512382,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0008389261784031987,
          "clip_ratio/high_max": 0.0008389261784031987,
          "clip_ratio/region_mean": 0.0008389261784031987,
          "step_time": 83.72439446099997,
          "entropy_control/entropy": 0.04263105424006609,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 83.613728,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.05533386394381523,
          "grad_norm": 0.1728515625,
          "learning_rate": 3.2000000000000003e-06,
          "num_tokens": 510224.0,
          "completions/mean_length": 310.375,
          "completions/min_length": 232.0,
          "completions/max_length": 636.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 310.375,
          "completions/min_terminated_length": 232.0,
          "completions/max_terminated_length": 636.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.21875,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0883883461356163,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.01874999701976776,
          "reward_std": 0.0883883461356163,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.024597404757514596,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 222.9520893609988,
          "entropy_control/entropy": 0.023220469573852827,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 135.606779,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 152.403962,
          "forward_backward_time": 70.451005,
          "rollout_overhead_time": 16.797183
        },
        {
          "step": 36,
          "loss": -0.05530177056789398,
          "grad_norm": 0.181640625,
          "learning_rate": 3e-06,
          "entropy": 0.024223731132224202,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.00019654087373055518,
          "clip_ratio/high_max": 0.00019654087373055518,
          "clip_ratio/region_mean": 0.00019654087373055518,
          "step_time": 70.51143897200109,
          "entropy_control/entropy": 0.02296708882910044,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 70.429582,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.11811134964227676,
          "grad_norm": 0.2353515625,
          "learning_rate": 2.8000000000000003e-06,
          "num_tokens": 535854.0,
          "completions/mean_length": 319.75,
          "completions/min_length": 255.0,
          "completions/max_length": 483.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 319.75,
          "completions/min_terminated_length": 255.0,
          "completions/max_terminated_length": 483.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6132173538208008,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 1.1980384897469776e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5245044231414795,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.18301118910312653,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "reward": 0.735527515411377,
          "reward_std": 0.2770969271659851,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.07394927646964788,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 243.5064796279994,
          "entropy_control/entropy": 0.0762606649121152,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 141.841758,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 160.718509,
          "forward_backward_time": 82.700984,
          "rollout_overhead_time": 18.876751
        },
        {
          "step": 38,
          "loss": 0.11816050857305527,
          "grad_norm": 0.2177734375,
          "learning_rate": 2.6e-06,
          "entropy": 0.07379282952751964,
          "clip_ratio/low_mean": 0.0002587991766631603,
          "clip_ratio/low_min": 0.0002587991766631603,
          "clip_ratio/high_mean": 0.00045454545761458576,
          "clip_ratio/high_max": 0.00045454545761458576,
          "clip_ratio/region_mean": 0.0007133446342777461,
          "step_time": 82.81517247699958,
          "entropy_control/entropy": 0.07615786743315026,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.713856,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.25485917925834656,
          "grad_norm": 0.189453125,
          "learning_rate": 2.4000000000000003e-06,
          "num_tokens": 563256.0,
          "completions/mean_length": 330.25,
          "completions/min_length": 239.0,
          "completions/max_length": 755.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 330.25,
          "completions/min_terminated_length": 239.0,
          "completions/max_terminated_length": 755.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5582360029220581,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.15485496819019318,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.15430335700511932,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7249026298522949,
          "reward_std": 0.3030456602573395,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.03695832286030054,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 241.49042306200045,
          "entropy_control/entropy": 0.041021604389103454,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": -0.0001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 153.868856,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 170.668723,
          "forward_backward_time": 70.71586,
          "rollout_overhead_time": 16.799866
        },
        {
          "step": 40,
          "loss": 0.25534555315971375,
          "grad_norm": 0.2451171875,
          "learning_rate": 2.2e-06,
          "entropy": 0.03707983472850174,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0007852564158383757,
          "clip_ratio/high_max": 0.0007852564158383757,
          "clip_ratio/region_mean": 0.0007852564158383757,
          "step_time": 70.82481263099999,
          "entropy_control/entropy": 0.041115449063686735,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": -0.0001,
          "entropy_control/zeta_next": -0.0002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 70.720887,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.0006246133707463741,
          "grad_norm": 0.00579833984375,
          "learning_rate": 2.0000000000000003e-06,
          "num_tokens": 593164.0,
          "completions/mean_length": 257.5,
          "completions/min_length": 234.0,
          "completions/max_length": 309.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 257.5,
          "completions/min_terminated_length": 234.0,
          "completions/max_terminated_length": 309.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6161777973175049,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 1.2583028592416667e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.4414222240447998,
          "reward_std": 0.41844794154167175,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02481665855157189,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 181.7729249949989,
          "entropy_control/entropy": 0.025124236636757252,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": -0.0002,
          "entropy_control/zeta_next": -0.0001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 84.861507,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 103.006375,
          "forward_backward_time": 78.664182,
          "rollout_overhead_time": 18.144868
        },
        {
          "step": 42,
          "loss": -0.0006263978430069983,
          "grad_norm": 0.0020904541015625,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.024449583375826478,
          "clip_ratio/low_mean": 0.00046296295477077365,
          "clip_ratio/low_min": 0.00046296295477077365,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.00046296295477077365,
          "step_time": 78.73975231299937,
          "entropy_control/entropy": 0.024743860042287756,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": -0.0001,
          "entropy_control/zeta_next": 0.0001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.642634,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 43,
          "loss": -5.60487387701869e-06,
          "grad_norm": 0.0013275146484375,
          "learning_rate": 1.6000000000000001e-06,
          "num_tokens": 621931.0,
          "completions/mean_length": 287.875,
          "completions/min_length": 266.0,
          "completions/max_length": 349.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 287.875,
          "completions/min_terminated_length": 266.0,
          "completions/max_terminated_length": 349.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6159943342208862,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 1.6671551748004276e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6147299408912659,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.0695671335270163e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8320287466049194,
          "reward_std": 0.0006758717936463654,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02148130163550377,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 190.59470718299963,
          "entropy_control/entropy": 0.021568277703800976,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0001,
          "entropy_control/zeta_next": 0.0002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 93.406351,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 111.931507,
          "forward_backward_time": 78.561703,
          "rollout_overhead_time": 18.525157
        },
        {
          "step": 44,
          "loss": -4.204513970762491e-06,
          "grad_norm": 0.00150299072265625,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.021757159032858908,
          "clip_ratio/low_mean": 0.0004448398540262133,
          "clip_ratio/low_min": 0.0004448398540262133,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0004448398540262133,
          "step_time": 78.65292478099946,
          "entropy_control/entropy": 0.021835107669043168,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0002,
          "entropy_control/zeta_next": 0.0004,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 78.555987,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.0010895675513893366,
          "grad_norm": 0.00445556640625,
          "learning_rate": 1.2000000000000002e-06,
          "num_tokens": 653773.0,
          "completions/mean_length": 306.25,
          "completions/min_length": 214.0,
          "completions/max_length": 500.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 306.25,
          "completions/min_terminated_length": 214.0,
          "completions/max_terminated_length": 500.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6127362847328186,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.9606213754741475e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.43970146775245667,
          "reward_std": 0.41660842299461365,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.020556892210152,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 232.68937776899838,
          "entropy_control/entropy": 0.020748718833716467,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0004,
          "entropy_control/zeta_next": 0.0008,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 121.29158,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 141.831924,
          "forward_backward_time": 90.746301,
          "rollout_overhead_time": 20.540344
        },
        {
          "step": 46,
          "loss": -0.0010817635338753462,
          "grad_norm": 0.0036773681640625,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.020918297610478476,
          "clip_ratio/low_mean": 0.0004310344811528921,
          "clip_ratio/low_min": 0.0004310344811528921,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0004310344811528921,
          "step_time": 90.8428927979985,
          "entropy_control/entropy": 0.021136172758211988,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0008,
          "entropy_control/zeta_next": 0.0016,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 90.731511,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 47,
          "loss": -4.239944973960519e-05,
          "grad_norm": 0.001312255859375,
          "learning_rate": 8.000000000000001e-07,
          "num_tokens": 682413.0,
          "completions/mean_length": 289.5,
          "completions/min_length": 251.0,
          "completions/max_length": 342.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 289.5,
          "completions/min_terminated_length": 251.0,
          "completions/max_terminated_length": 342.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6142542362213135,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 7.160831501096254e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8299664258956909,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 8.787053502601339e-07,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.938776969909668,
          "reward_std": 0.11530302464962006,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.016255779890343547,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 197.25902485600272,
          "entropy_control/entropy": 0.016405128539524992,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0016,
          "entropy_control/zeta_next": 0.0032,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 99.347984,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 118.015269,
          "forward_backward_time": 79.122098,
          "rollout_overhead_time": 18.667285
        },
        {
          "step": 48,
          "loss": -4.2037107050418854e-05,
          "grad_norm": 0.001129150390625,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.016197846503928304,
          "clip_ratio/low_mean": 0.00048638132284395397,
          "clip_ratio/low_min": 0.00048638132284395397,
          "clip_ratio/high_mean": 0.000405844155466184,
          "clip_ratio/high_max": 0.000405844155466184,
          "clip_ratio/region_mean": 0.000892225478310138,
          "step_time": 79.22551988899613,
          "entropy_control/entropy": 0.0163411147522479,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0032,
          "entropy_control/zeta_next": 0.0064,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.109247,
          "rollout_overhead_time": 0.0,
          "reward": null
        },
        {
          "step": 49,
          "loss": -0.0002504608128219843,
          "grad_norm": 0.00145721435546875,
          "learning_rate": 4.0000000000000003e-07,
          "num_tokens": 711149.0,
          "completions/mean_length": 297.0,
          "completions/min_length": 257.0,
          "completions/max_length": 334.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 297.0,
          "completions/min_terminated_length": 257.0,
          "completions/max_terminated_length": 334.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6137466430664062,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 1.442054781364277e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8306776285171509,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 1.1552644991752459e-06,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9388787746429443,
          "reward_std": 0.11595447361469269,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.02201947581488639,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 193.7512692649998,
          "entropy_control/entropy": 0.022578372963406326,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0064,
          "entropy_control/zeta_next": 0.0128,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 95.730815,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 114.432158,
          "forward_backward_time": 79.207311,
          "rollout_overhead_time": 18.701343
        },
        {
          "step": 50,
          "loss": -0.0002588336355984211,
          "grad_norm": 0.0013275146484375,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.021800043410621583,
          "clip_ratio/low_mean": 0.0004139072843827307,
          "clip_ratio/low_min": 0.0004139072843827307,
          "clip_ratio/high_mean": 0.000800051202531904,
          "clip_ratio/high_max": 0.000800051202531904,
          "clip_ratio/region_mean": 0.0012139584869146347,
          "step_time": 79.27377721599987,
          "entropy_control/entropy": 0.022359675930595898,
          "entropy_control/target": 0.03175173258437593,
          "entropy_control/zeta_used": 0.0128,
          "entropy_control/zeta_next": 0.0256,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 79.174211,
          "rollout_overhead_time": 0.0,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6170665707246713,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 344,
          "reward_channels": {
            "native": 0.6170665707246713,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6170664895195931,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 288,
          "reward_channels": {
            "native": 0.6170664895195931,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6170663329743196,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 274,
          "reward_channels": {
            "native": 0.6170663329743196,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6170653436345541,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 375,
          "reward_channels": {
            "native": 0.6170653436345541,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6176353807103607,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 272,
          "reward_channels": {
            "native": 0.6176353807103607,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6176363454881537,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 346,
          "reward_channels": {
            "native": 0.6176363454881537,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.617635481460556,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 409,
          "reward_channels": {
            "native": 0.617635481460556,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6176363608829585,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 342,
          "reward_channels": {
            "native": 0.6176363608829585,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6181042530675553,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 380,
          "reward_channels": {
            "native": 0.6181042530675553,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6181059146631999,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 261,
          "reward_channels": {
            "native": 0.6181059146631999,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.61810598559111,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 258,
          "reward_channels": {
            "native": 0.61810598559111,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6181054220639031,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 259,
          "reward_channels": {
            "native": 0.6181054220639031,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6188066805953297,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 247,
          "reward_channels": {
            "native": 0.6188066805953297,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6188069888191968,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 264,
          "reward_channels": {
            "native": 0.6188069888191968,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.618805890198689,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 302,
          "reward_channels": {
            "native": 0.618805890198689,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6188056475190211,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 233,
          "reward_channels": {
            "native": 0.6188056475190211,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 357,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 243,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 278,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 284,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 238,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 256,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 284,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 251,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6170014806407986,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 305,
          "reward_channels": {
            "native": 0.6170014806407986,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6170025229249978,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 302,
          "reward_channels": {
            "native": 0.6170025229249978,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6170025763343728,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 319,
          "reward_channels": {
            "native": 0.6170025763343728,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6169999447661306,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 310,
          "reward_channels": {
            "native": 0.6169999447661306,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6170328837317088,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 349,
          "reward_channels": {
            "native": 0.6170328837317088,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.617033260678955,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 286,
          "reward_channels": {
            "native": 0.617033260678955,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6170340618311814,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 301,
          "reward_channels": {
            "native": 0.6170340618311814,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6170338136804978,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 323,
          "reward_channels": {
            "native": 0.6170338136804978,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 395,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8326690123331902,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 273,
          "reward_channels": {
            "native": 0.8326690123331902,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8326679764228776,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 257,
          "reward_channels": {
            "native": 0.8326679764228776,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8326674563266472,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 244,
          "reward_channels": {
            "native": 0.8326674563266472,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.831750250372806,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 267,
          "reward_channels": {
            "native": 0.831750250372806,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8317517377728061,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 279,
          "reward_channels": {
            "native": 0.8317517377728061,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8317508980261654,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 295,
          "reward_channels": {
            "native": 0.8317508980261654,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8317511159244272,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 317,
          "reward_channels": {
            "native": 0.8317511159244272,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789206045",
      "mode": "thinking",
      "method": "initial",
      "steps": 0,
      "reward_points": 0,
      "train_mean": null,
      "train_last10": null,
      "holdout_native": 0.6829987846910179,
      "holdout_episodes": 40,
      "holdout_successes": 37,
      "mean_step_seconds": null,
      "label": "Starting model",
      "state_at_cutoff": "complete",
      "step_hours": null,
      "peak_allocated_gib": null,
      "peak_reserved_gib": null,
      "extra_refill_rounds": 0,
      "groups_refilled": 0,
      "holdout_component_means": {
        "native": 0.6829987846910179,
        "efficiency": 0.47500000000000003,
        "reliability": 0.9
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "grpo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "grpo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "entropy_holdout_episodes.jsonl": "c7f822f8a8efb2c3874e80c1c84ebe5ed698a1cd94cf7d52a34ddedde00c43de",
        "resolved_training_config.json": "c3ce95171643c1ef9031ab4b7725f95cbac874cdbd24b5701e0f5d72e7faffdd"
      },
      "training_steps": [],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8591328836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 5522,
          "reward_channels": {
            "native": 0.8591328836248219,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3125,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2562,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3074,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2810,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2722,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8523284576243806,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3715,
          "reward_channels": {
            "native": 0.8523284576243806,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8388160328689895,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 5088,
          "reward_channels": {
            "native": 0.8388160328689895,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8204653155141224,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4035,
          "reward_channels": {
            "native": 0.8204653155141224,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2998,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3183,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3891,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.844761535440721,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5955,
          "reward_channels": {
            "native": 0.844761535440721,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.9758783046350626,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 4277,
          "reward_channels": {
            "native": 0.9758783046350626,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 2884,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2925,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6093677238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 7711,
          "reward_channels": {
            "native": 0.6093677238672119,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2934,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.7248594440979103,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6550,
          "reward_channels": {
            "native": 0.7248594440979103,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 8190,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.7053628099527464,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6703,
          "reward_channels": {
            "native": 0.7053628099527464,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6512057439829095,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5598,
          "reward_channels": {
            "native": 0.6512057439829095,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5775,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1571,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1724,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3047,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3127,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 6199,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8461963597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4440,
          "reward_channels": {
            "native": 0.8461963597959128,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8461963597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 3475,
          "reward_channels": {
            "native": 0.8461963597959128,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3138,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2136,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.9870115723152173,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5056,
          "reward_channels": {
            "native": 0.9870115723152173,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.7421847681444665,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4983,
          "reward_channels": {
            "native": 0.7421847681444665,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3457,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3160,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3082,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.9607157572618796,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 2974,
          "reward_channels": {
            "native": 0.9607157572618796,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5269,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789214712",
      "mode": "thinking",
      "method": "grpo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8361628222465515,
      "train_last10": 0.8823877453804017,
      "holdout_native": 0.67982993828857,
      "holdout_episodes": 40,
      "holdout_successes": 38,
      "mean_step_seconds": 929.1267989518816,
      "label": "GRPO",
      "state_at_cutoff": "complete",
      "step_hours": 12.904538874331687,
      "peak_allocated_gib": 69.07209730148315,
      "peak_reserved_gib": 76.8828125,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.67982993828857,
        "efficiency": 0.47500000000000003,
        "reliability": 0.9
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "grpo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "grpo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "1d1057f4bd367542b8b9ba65b0caffe5d8e63ad940b5455a1a2a84bcd6b6fe52",
        "entropy_holdout_episodes.jsonl": "6c178b921e99405eed0a9e9ac490a957959ba3f659cdd16cbbd274301c59eeb6",
        "resolved_training_config.json": "0cef43498f7ff664838a990e829bf9c4051c37d27a688a8973e0c7aeec07b616"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -0.21574446558952332,
          "grad_norm": 0.061767578125,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1323.271556528,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1131.710895,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1166.291479,
          "forward_backward_time": 156.873074,
          "rollout_overhead_time": 34.580584,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": -0.21584278345108032,
          "grad_norm": 0.05908203125,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14546925388276577,
          "clip_ratio/low_mean": 0.00041601009434089065,
          "clip_ratio/low_min": 0.00041601009434089065,
          "clip_ratio/high_mean": 0.002612101990962401,
          "clip_ratio/high_max": 0.002612101990962401,
          "clip_ratio/region_mean": 0.0030281120853032917,
          "step_time": 156.92217275399935,
          "entropy_control/entropy": 0.2002554157113976,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.814344,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": 5.21540641784668e-08,
          "grad_norm": 0.06884765625,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 679.5833333333333,
          "thinking/budget_hit_fraction": 0.175,
          "num_tokens": 102514.0,
          "completions/mean_length": 3605.375,
          "completions/min_length": 2236.0,
          "completions/max_length": 5501.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3605.375,
          "completions/min_terminated_length": 2236.0,
          "completions/max_terminated_length": 5501.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7024504542350769,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12899158895015717,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.12598817050457,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.9316171407699585,
          "reward_std": 0.12343566864728928,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21422390453517437,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1171.6926818000006,
          "entropy_control/entropy": 0.22008486084324633,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1006.966434,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1036.049033,
          "forward_backward_time": 135.534431,
          "rollout_overhead_time": 29.0826,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.51171875
        },
        {
          "step": 4,
          "loss": 9.134411811828613e-05,
          "grad_norm": 0.064453125,
          "learning_rate": 9.4e-06,
          "entropy": 0.2134654000401497,
          "clip_ratio/low_mean": 0.0019264514558017254,
          "clip_ratio/low_min": 0.0019264514558017254,
          "clip_ratio/high_mean": 0.0014562738069798797,
          "clip_ratio/high_max": 0.0014562738069798797,
          "clip_ratio/region_mean": 0.003382725262781605,
          "step_time": 135.64331109700015,
          "entropy_control/entropy": 0.2193793956353516,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 135.532583,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.51171875,
          "reward": null
        },
        {
          "step": 5,
          "loss": -1.4901161193847656e-08,
          "grad_norm": 0.056884765625,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 591.5535714285714,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 157826.0,
          "completions/mean_length": 4209.0,
          "completions/min_length": 2236.0,
          "completions/max_length": 7215.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4209.0,
          "completions/min_terminated_length": 2236.0,
          "completions/max_terminated_length": 7215.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.19230769574642181,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6130115389823914,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.20563623309135437,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1767766922712326,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8411365747451782,
          "reward_std": 0.20309090614318848,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19480029679834843,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1640.3757725910004,
          "entropy_control/entropy": 0.19811476079643126,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 1441.471157,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1475.959354,
          "forward_backward_time": 164.32011,
          "rollout_overhead_time": 34.488197,
          "peak_allocated_gib": 48.77573108673096,
          "peak_reserved_gib": 54.79296875
        },
        {
          "step": 6,
          "loss": -0.00023845583200454712,
          "grad_norm": 0.058837890625,
          "learning_rate": 9e-06,
          "entropy": 0.19437631219625473,
          "clip_ratio/low_mean": 0.0007464685040758923,
          "clip_ratio/low_min": 0.0007464685040758923,
          "clip_ratio/high_mean": 0.00285797004471533,
          "clip_ratio/high_max": 0.00285797004471533,
          "clip_ratio/region_mean": 0.0036044385487912223,
          "step_time": 164.45583199400062,
          "entropy_control/entropy": 0.19769418170238393,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 164.354975,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 48.77573108673096,
          "peak_reserved_gib": 54.79296875,
          "reward": null
        },
        {
          "step": 7,
          "loss": -2.2351741790771484e-08,
          "grad_norm": 0.0751953125,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 618.3360544217687,
          "thinking/budget_hit_fraction": 0.1096938775510204,
          "num_tokens": 223699.0,
          "completions/mean_length": 4766.625,
          "completions/min_length": 1827.0,
          "completions/max_length": 6732.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4766.625,
          "completions/min_terminated_length": 1827.0,
          "completions/max_terminated_length": 6732.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4570293426513672,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2840198874473572,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8914890885353088,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0759979858994484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.7878009080886841,
          "reward_std": 0.48873358964920044,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21208408661186695,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2296.4392685740004,
          "entropy_control/entropy": 0.2186813504668633,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 2005.50317,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2055.451308,
          "forward_backward_time": 240.881205,
          "rollout_overhead_time": 49.948137,
          "peak_allocated_gib": 60.44094133377075,
          "peak_reserved_gib": 66.74609375
        },
        {
          "step": 8,
          "loss": 2.8386712074279785e-06,
          "grad_norm": 0.07373046875,
          "learning_rate": 8.6e-06,
          "entropy": 0.21231159567832947,
          "clip_ratio/low_mean": 0.000925836808164604,
          "clip_ratio/low_min": 0.000925836808164604,
          "clip_ratio/high_mean": 0.003548822656739503,
          "clip_ratio/high_max": 0.003548822656739503,
          "clip_ratio/region_mean": 0.004474659464904107,
          "step_time": 240.87562695600081,
          "entropy_control/entropy": 0.21879905398527097,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 240.788066,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 60.44094133377075,
          "peak_reserved_gib": 66.74609375,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.18661607801914215,
          "grad_norm": 0.052001953125,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 743.3154761904761,
          "thinking/budget_hit_fraction": 0.23214285714285712,
          "num_tokens": 280527.0,
          "completions/mean_length": 3819.5,
          "completions/min_length": 2234.0,
          "completions/max_length": 5961.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3926.4287109375,
          "completions/min_terminated_length": 2234.0,
          "completions/max_terminated_length": 5961.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6691635251045227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11923417448997498,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.504158616065979,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.34144195914268494,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7606194019317627,
          "reward_std": 0.3968806862831116,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17925255000591278,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1397.8388155039956,
          "entropy_control/entropy": 0.2161763805416,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1162.674265,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1203.702736,
          "forward_backward_time": 194.042967,
          "rollout_overhead_time": 41.028471,
          "peak_allocated_gib": 60.44094133377075,
          "peak_reserved_gib": 66.74609375
        },
        {
          "step": 10,
          "loss": -0.1866154670715332,
          "grad_norm": 0.052978515625,
          "learning_rate": 8.2e-06,
          "entropy": 0.1790898609906435,
          "clip_ratio/low_mean": 0.0010788068029796705,
          "clip_ratio/low_min": 0.0010788068029796705,
          "clip_ratio/high_mean": 0.0018942377355415374,
          "clip_ratio/high_max": 0.0018942377355415374,
          "clip_ratio/region_mean": 0.002973044538521208,
          "step_time": 194.0120085890012,
          "entropy_control/entropy": 0.21600092876164814,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 193.926184,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 60.44094133377075,
          "peak_reserved_gib": 66.74609375,
          "reward": null
        },
        {
          "step": 11,
          "loss": -7.450580596923828e-08,
          "grad_norm": 0.060302734375,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 635.5285714285714,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 345071.0,
          "completions/mean_length": 4759.0,
          "completions/min_length": 2510.0,
          "completions/max_length": 6892.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4759.0,
          "completions/min_terminated_length": 2510.0,
          "completions/max_terminated_length": 6892.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6681309938430786,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.09295085072517395,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6374233365058899,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2812902331352234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.8246521353721619,
          "reward_std": 0.33009234070777893,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20426424033939838,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1640.2230279159976,
          "entropy_control/entropy": 0.20939805002587633,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1393.853113,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1436.092919,
          "forward_backward_time": 204.02604,
          "rollout_overhead_time": 42.239806,
          "peak_allocated_gib": 60.44094133377075,
          "peak_reserved_gib": 66.74609375
        },
        {
          "step": 12,
          "loss": 0.0002558119595050812,
          "grad_norm": 0.056884765625,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.2042933963239193,
          "clip_ratio/low_mean": 0.0008133799565257505,
          "clip_ratio/low_min": 0.0008133799565257505,
          "clip_ratio/high_mean": 0.0018578044255264103,
          "clip_ratio/high_max": 0.0018578044255264103,
          "clip_ratio/region_mean": 0.002671184382052161,
          "step_time": 204.0847907480038,
          "entropy_control/entropy": 0.20943264558814864,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 203.983037,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 60.44094133377075,
          "peak_reserved_gib": 66.74609375,
          "reward": null
        },
        {
          "step": 13,
          "loss": -1.2665987014770508e-06,
          "grad_norm": 0.0556640625,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 696.3249999999999,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 409316.0,
          "completions/mean_length": 4745.625,
          "completions/min_length": 2706.0,
          "completions/max_length": 6542.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4745.625,
          "completions/min_terminated_length": 2706.0,
          "completions/max_terminated_length": 6542.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6175202131271362,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.015931161120533943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6163814663887024,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.28774014115333557,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7877841591835022,
          "reward_std": 0.3165474534034729,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21027977019548416,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1913.5732425510032,
          "entropy_control/entropy": 0.20998974643007895,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1568.566726,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1626.641259,
          "forward_backward_time": 286.821186,
          "rollout_overhead_time": 58.074533,
          "peak_allocated_gib": 66.42686176300049,
          "peak_reserved_gib": 73.69921875
        },
        {
          "step": 14,
          "loss": 0.0003102123737335205,
          "grad_norm": 0.0556640625,
          "learning_rate": 7.4e-06,
          "entropy": 0.20994763262569904,
          "clip_ratio/low_mean": 0.0009998756722779945,
          "clip_ratio/low_min": 0.0009998756722779945,
          "clip_ratio/high_mean": 0.002319482999155298,
          "clip_ratio/high_max": 0.002319482999155298,
          "clip_ratio/region_mean": 0.0033193586714332923,
          "step_time": 286.9272500799998,
          "entropy_control/entropy": 0.20963220479580932,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 286.812957,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42686176300049,
          "peak_reserved_gib": 73.69921875,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.10666165500879288,
          "grad_norm": 0.060546875,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 781.7341836734694,
          "thinking/budget_hit_fraction": 0.18367346938775508,
          "num_tokens": 478171.0,
          "completions/mean_length": 5123.375,
          "completions/min_length": 3286.0,
          "completions/max_length": 8884.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5385.857421875,
          "completions/min_terminated_length": 3309.0,
          "completions/max_terminated_length": 8884.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.45868855714797974,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3439096212387085,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8778764009475708,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06689149886369705,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.7849491834640503,
          "reward_std": 0.5093115568161011,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14890395756810904,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2235.668606463003,
          "entropy_control/entropy": 0.17151553053826665,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1889.736014,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1948.062797,
          "forward_backward_time": 287.493484,
          "rollout_overhead_time": 58.326782,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 16,
          "loss": -0.10667812824249268,
          "grad_norm": 0.05224609375,
          "learning_rate": 7e-06,
          "entropy": 0.14920903742313385,
          "clip_ratio/low_mean": 0.0006815678352722898,
          "clip_ratio/low_min": 0.0006815678352722898,
          "clip_ratio/high_mean": 0.0020250110828783363,
          "clip_ratio/high_max": 0.0020250110828783363,
          "clip_ratio/region_mean": 0.002706578918150626,
          "step_time": 287.58674787699965,
          "entropy_control/entropy": 0.1718210866764176,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 287.47271,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 17,
          "loss": 2.7939677238464355e-07,
          "grad_norm": 0.056640625,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 718.342857142857,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 550619.0,
          "completions/mean_length": 5365.0,
          "completions/min_length": 2833.0,
          "completions/max_length": 7500.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5365.0,
          "completions/min_terminated_length": 2833.0,
          "completions/max_terminated_length": 7500.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5120359063148499,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.22543221712112427,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.21516574919223785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7050560116767883,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1191813126206398,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7741709351539612,
          "reward_std": 0.3329608142375946,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18250237219035625,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2501.553329219005,
          "entropy_control/entropy": 0.17966567875644504,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 2181.071163,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2235.57908,
          "forward_backward_time": 265.860784,
          "rollout_overhead_time": 54.507917,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 18,
          "loss": 5.6877732276916504e-05,
          "grad_norm": 0.05419921875,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.1821766123175621,
          "clip_ratio/low_mean": 0.0008115740347420797,
          "clip_ratio/low_min": 0.0008115740347420797,
          "clip_ratio/high_mean": 0.0024077362031675875,
          "clip_ratio/high_max": 0.0024077362031675875,
          "clip_ratio/region_mean": 0.003219310237909667,
          "step_time": 266.0061489889995,
          "entropy_control/entropy": 0.1793118971963076,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 265.896535,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 19,
          "loss": -0.316281795501709,
          "grad_norm": 0.05078125,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 499.7142857142857,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 600620.0,
          "completions/mean_length": 3359.625,
          "completions/min_length": 1970.0,
          "completions/max_length": 4846.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3455.83349609375,
          "completions/min_terminated_length": 1970.0,
          "completions/max_terminated_length": 4846.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.4572652578353882,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.3048435151576996,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5300920009613037,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4792630672454834,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.5613870024681091,
          "reward_std": 0.5816197991371155,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14770432747900486,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1148.603929220004,
          "entropy_control/entropy": 0.1939812108135933,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 967.942453,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 999.918835,
          "forward_backward_time": 148.579143,
          "rollout_overhead_time": 31.976382,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 20,
          "loss": -0.31621694564819336,
          "grad_norm": 0.06689453125,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.14768492057919502,
          "clip_ratio/low_mean": 0.00045045046135783195,
          "clip_ratio/low_min": 0.00045045046135783195,
          "clip_ratio/high_mean": 0.0038841489295009524,
          "clip_ratio/high_max": 0.0038841489295009524,
          "clip_ratio/region_mean": 0.004334599390858784,
          "step_time": 148.67559428100503,
          "entropy_control/entropy": 0.19398792214377067,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 148.56869,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 21,
          "loss": -1.4156103134155273e-07,
          "grad_norm": 0.06982421875,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 643.1464285714285,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 671578.0,
          "completions/mean_length": 5170.75,
          "completions/min_length": 3667.0,
          "completions/max_length": 7026.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5170.75,
          "completions/min_terminated_length": 3667.0,
          "completions/max_terminated_length": 7026.0,
          "tools/call_frequency": 4.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5778571367263794,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.22537729144096375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7966060638427734,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0518668107688427,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957118570804596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.851814866065979,
          "reward_std": 0.33230361342430115,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19175784476101398,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2313.628858852,
          "entropy_control/entropy": 0.19590833289032367,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 2021.380127,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2071.198077,
          "forward_backward_time": 242.313947,
          "rollout_overhead_time": 49.81795,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 22,
          "loss": 0.00027307868003845215,
          "grad_norm": 0.0673828125,
          "learning_rate": 5.8e-06,
          "entropy": 0.19180474057793617,
          "clip_ratio/low_mean": 0.0010520591167733073,
          "clip_ratio/low_min": 0.0010520591167733073,
          "clip_ratio/high_mean": 0.002789115416817367,
          "clip_ratio/high_max": 0.002789115416817367,
          "clip_ratio/region_mean": 0.0038411745335906744,
          "step_time": 242.45853826799794,
          "entropy_control/entropy": 0.19600329028751037,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 242.338485,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 23,
          "loss": -0.18633608520030975,
          "grad_norm": 0.057373046875,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 625.1433673469388,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 727140.0,
          "completions/mean_length": 4059.75,
          "completions/min_length": 2731.0,
          "completions/max_length": 6460.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4201.0,
          "completions/min_terminated_length": 2731.0,
          "completions/max_terminated_length": 6460.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.8164325952529907,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.14929784834384918,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6595636606216431,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4462873339653015,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.9088314771652222,
          "reward_std": 0.4608263373374939,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16791206691414118,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1439.073491322004,
          "entropy_control/entropy": 0.19424822948180198,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1164.343427,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1210.54189,
          "forward_backward_time": 228.425522,
          "rollout_overhead_time": 46.198463,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 24,
          "loss": -0.186231330037117,
          "grad_norm": 0.055908203125,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.16807778552174568,
          "clip_ratio/low_mean": 0.00022885389626026154,
          "clip_ratio/low_min": 0.00022885389626026154,
          "clip_ratio/high_mean": 0.003561089630238712,
          "clip_ratio/high_max": 0.003561089630238712,
          "clip_ratio/region_mean": 0.0037899435264989734,
          "step_time": 228.50225764999777,
          "entropy_control/entropy": 0.1943999188217632,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 228.405244,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.18551751971244812,
          "grad_norm": 0.058349609375,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 582.3472222222223,
          "thinking/budget_hit_fraction": 0.08333333333333333,
          "num_tokens": 778744.0,
          "completions/mean_length": 3360.5,
          "completions/min_length": 1891.0,
          "completions/max_length": 5791.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3401.857177734375,
          "completions/min_terminated_length": 1891.0,
          "completions/max_terminated_length": 5791.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6715044975280762,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12447243928909302,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5514910221099854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.3796755373477936,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.782331109046936,
          "reward_std": 0.4086287319660187,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1782005950808525,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1346.7842622450007,
          "entropy_control/entropy": 0.1990801086140548,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1117.828152,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1157.694675,
          "forward_backward_time": 188.982338,
          "rollout_overhead_time": 39.866522,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 26,
          "loss": -0.18542535603046417,
          "grad_norm": 0.057373046875,
          "learning_rate": 5e-06,
          "entropy": 0.17806172370910645,
          "clip_ratio/low_mean": 0.001531724352389574,
          "clip_ratio/low_min": 0.001531724352389574,
          "clip_ratio/high_mean": 0.0026588996406644583,
          "clip_ratio/high_max": 0.0026588996406644583,
          "clip_ratio/region_mean": 0.004190623993054032,
          "step_time": 189.0860957010009,
          "entropy_control/entropy": 0.198946864873294,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 188.981787,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 27,
          "loss": 3.427267074584961e-07,
          "grad_norm": 0.05810546875,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 752.9513888888888,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 844036.0,
          "completions/mean_length": 4859.0,
          "completions/min_length": 2609.0,
          "completions/max_length": 6061.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4859.0,
          "completions/min_terminated_length": 2609.0,
          "completions/max_terminated_length": 6061.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6995120048522949,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11226262152194977,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.9193856716156006,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07096325606107712,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0302821397781372,
          "reward_std": 0.13856662809848785,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19423643127083778,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1773.342510265993,
          "entropy_control/entropy": 0.1916025433434907,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1524.595898,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1567.692393,
          "forward_backward_time": 205.54728,
          "rollout_overhead_time": 43.096495,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 28,
          "loss": 3.993511199951172e-06,
          "grad_norm": 0.058349609375,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.19427297078073025,
          "clip_ratio/low_mean": 0.0007872360074543394,
          "clip_ratio/low_min": 0.0007872360074543394,
          "clip_ratio/high_mean": 0.002591346390545368,
          "clip_ratio/high_max": 0.002591346390545368,
          "clip_ratio/region_mean": 0.0033785823979997076,
          "step_time": 205.62199108300047,
          "entropy_control/entropy": 0.19155715934777284,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 205.527939,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 29,
          "loss": -3.725290298461914e-08,
          "grad_norm": 0.095703125,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 692.3154761904761,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 911325.0,
          "completions/mean_length": 5128.625,
          "completions/min_length": 2756.0,
          "completions/max_length": 6932.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5128.625,
          "completions/min_terminated_length": 2756.0,
          "completions/max_terminated_length": 6932.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.735346257686615,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.14634527266025543,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5230018496513367,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.32128164172172546,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.7447990775108337,
          "reward_std": 0.4406716227531433,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20591633208096027,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2090.9175203540035,
          "entropy_control/entropy": 0.203890279917937,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1784.526045,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1836.761119,
          "forward_backward_time": 254.058516,
          "rollout_overhead_time": 52.235075,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 30,
          "loss": 0.00021416693925857544,
          "grad_norm": 0.058349609375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.2061260398477316,
          "clip_ratio/low_mean": 0.0010790508677018806,
          "clip_ratio/low_min": 0.0010790508677018806,
          "clip_ratio/high_mean": 0.002600030682515353,
          "clip_ratio/high_max": 0.002600030682515353,
          "clip_ratio/region_mean": 0.0036790815502172336,
          "step_time": 254.11358457000097,
          "entropy_control/entropy": 0.2040441510170926,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 254.021738,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 31,
          "loss": -4.470348358154297e-08,
          "grad_norm": 0.06982421875,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 724.2827380952381,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 974705.0,
          "completions/mean_length": 4839.0,
          "completions/min_length": 3435.0,
          "completions/max_length": 7366.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4839.0,
          "completions/min_terminated_length": 3435.0,
          "completions/max_terminated_length": 7366.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.06451612710952759,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8607076406478882,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06753762811422348,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3958333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.21707837283611298,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0804994106292725,
          "reward_std": 0.061188261955976486,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16757085174322128,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1802.356435463993,
          "entropy_control/entropy": 0.16794919033265657,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1547.406371,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1591.136157,
          "forward_backward_time": 211.123917,
          "rollout_overhead_time": 43.729786,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 32,
          "loss": 7.340312004089355e-05,
          "grad_norm": 0.0654296875,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.16734056919813156,
          "clip_ratio/low_mean": 0.0014973652141634375,
          "clip_ratio/low_min": 0.0014973652141634375,
          "clip_ratio/high_mean": 0.00299794934107922,
          "clip_ratio/high_max": 0.00299794934107922,
          "clip_ratio/region_mean": 0.004495314555242658,
          "step_time": 211.18617562500003,
          "entropy_control/entropy": 0.16773713178710217,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 211.081678,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 33,
          "loss": -5.364418029785156e-07,
          "grad_norm": 0.040771484375,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 641.875,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 1026740.0,
          "completions/mean_length": 3608.875,
          "completions/min_length": 1955.0,
          "completions/max_length": 6699.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3608.875,
          "completions/min_terminated_length": 1955.0,
          "completions/max_terminated_length": 6699.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6095701456069946,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8578818440437317,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06588447093963623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9628927111625671,
          "reward_std": 0.13321620225906372,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18777185678482056,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1280.3155918770062,
          "entropy_control/entropy": 0.19526047992356108,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1039.468172,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1080.972167,
          "forward_backward_time": 199.239674,
          "rollout_overhead_time": 41.503995,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 34,
          "loss": 0.00017583370208740234,
          "grad_norm": 0.037109375,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.18781633861362934,
          "clip_ratio/low_mean": 0.0009418768458999693,
          "clip_ratio/low_min": 0.0009418768458999693,
          "clip_ratio/high_mean": 0.0004291685181669891,
          "clip_ratio/high_max": 0.0004291685181669891,
          "clip_ratio/region_mean": 0.0013710453640669584,
          "step_time": 199.357629935992,
          "entropy_control/entropy": 0.19529972474706533,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 199.256936,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 35,
          "loss": -2.3096799850463867e-07,
          "grad_norm": 0.0712890625,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 873.9464285714286,
          "thinking/budget_hit_fraction": 0.25,
          "num_tokens": 1103774.0,
          "completions/mean_length": 5766.25,
          "completions/min_length": 2389.0,
          "completions/max_length": 7394.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5766.25,
          "completions/min_terminated_length": 2389.0,
          "completions/max_terminated_length": 7394.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6741191744804382,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.05711929872632027,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.17251639068126678,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8928691148757935,
          "reward_std": 0.0518985390663147,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2012415211647749,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2107.7353201419974,
          "entropy_control/entropy": 0.1924563170504371,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1804.905781,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1856.314271,
          "forward_backward_time": 251.322372,
          "rollout_overhead_time": 51.40849,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 36,
          "loss": -2.5227665901184082e-05,
          "grad_norm": 0.06689453125,
          "learning_rate": 3e-06,
          "entropy": 0.20116382464766502,
          "clip_ratio/low_mean": 0.0009656167385401204,
          "clip_ratio/low_min": 0.0009656167385401204,
          "clip_ratio/high_mean": 0.0029716521385125816,
          "clip_ratio/high_max": 0.0029716521385125816,
          "clip_ratio/region_mean": 0.003937268877052702,
          "step_time": 251.40516569999454,
          "entropy_control/entropy": 0.1923181859802659,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 251.302596,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.18385322391986847,
          "grad_norm": 0.0625,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 827.7901785714286,
          "thinking/budget_hit_fraction": 0.2544642857142857,
          "num_tokens": 1154849.0,
          "completions/mean_length": 3504.375,
          "completions/min_length": 2713.0,
          "completions/max_length": 4893.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3566.285888671875,
          "completions/min_terminated_length": 2713.0,
          "completions/max_terminated_length": 4893.0,
          "tools/call_frequency": 2.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6686257123947144,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11784413456916809,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5199053883552551,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.3654637634754181,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "reward": 0.7713488340377808,
          "reward_std": 0.4063173830509186,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1783539429306984,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1005.5948500160011,
          "entropy_control/entropy": 0.2105146749393795,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 868.938258,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 893.617108,
          "forward_backward_time": 111.879814,
          "rollout_overhead_time": 24.678851,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 38,
          "loss": -0.18384769558906555,
          "grad_norm": 0.047607421875,
          "learning_rate": 2.6e-06,
          "entropy": 0.17824725061655045,
          "clip_ratio/low_mean": 0.0005780552310170606,
          "clip_ratio/low_min": 0.0005780552310170606,
          "clip_ratio/high_mean": 0.0020121496345382184,
          "clip_ratio/high_max": 0.0020121496345382184,
          "clip_ratio/region_mean": 0.002590204865555279,
          "step_time": 111.95662548500695,
          "entropy_control/entropy": 0.21051747600180507,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 111.863829,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 39,
          "loss": -1.2852251529693604e-07,
          "grad_norm": 0.072265625,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 447.7023809523809,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 1205242.0,
          "completions/mean_length": 3208.125,
          "completions/min_length": 1977.0,
          "completions/max_length": 4848.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3208.125,
          "completions/min_terminated_length": 1977.0,
          "completions/max_terminated_length": 4848.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6351134777069092,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.20579981803894043,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.25197634100914,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.8101135492324829,
          "reward_std": 0.3326144516468048,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18824629299342632,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1055.1161288180156,
          "entropy_control/entropy": 0.18568970518463374,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 814.417533,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 856.038607,
          "forward_backward_time": 198.978442,
          "rollout_overhead_time": 41.621073,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625
        },
        {
          "step": 40,
          "loss": 5.204230546951294e-05,
          "grad_norm": 0.0810546875,
          "learning_rate": 2.2e-06,
          "entropy": 0.1873590387403965,
          "clip_ratio/low_mean": 0.001982754183700308,
          "clip_ratio/low_min": 0.001982754183700308,
          "clip_ratio/high_mean": 0.0030543222092092037,
          "clip_ratio/high_max": 0.0030543222092092037,
          "clip_ratio/region_mean": 0.005037076392909512,
          "step_time": 199.11226085701492,
          "entropy_control/entropy": 0.18497066177414806,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 199.009806,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.76106929779053,
          "peak_reserved_gib": 74.265625,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.1802990734577179,
          "grad_norm": 0.0634765625,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 610.0527210884354,
          "thinking/budget_hit_fraction": 0.12755102040816327,
          "num_tokens": 1267954.0,
          "completions/mean_length": 4362.0,
          "completions/min_length": 2725.0,
          "completions/max_length": 7129.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4546.4287109375,
          "completions/min_terminated_length": 2725.0,
          "completions/max_terminated_length": 7129.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0357142873108387,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7108664512634277,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.11576669663190842,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5521032810211182,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.40590348839759827,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.797109842300415,
          "reward_std": 0.42240777611732483,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16891460679471493,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1965.8781912580016,
          "entropy_control/entropy": 0.1970858858765876,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1598.035267,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1659.726971,
          "forward_backward_time": 306.050515,
          "rollout_overhead_time": 61.691704,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125
        },
        {
          "step": 42,
          "loss": -0.18048246204853058,
          "grad_norm": 0.055419921875,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.16886846721172333,
          "clip_ratio/low_mean": 0.0005234681011643261,
          "clip_ratio/low_min": 0.0005234681011643261,
          "clip_ratio/high_mean": 0.00373097465489991,
          "clip_ratio/high_max": 0.00373097465489991,
          "clip_ratio/region_mean": 0.004254442756064236,
          "step_time": 306.1554447550079,
          "entropy_control/entropy": 0.1969915345860917,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 306.054867,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.1847926378250122,
          "grad_norm": 0.08056640625,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 497.8384353741497,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 1321735.0,
          "completions/mean_length": 3418.625,
          "completions/min_length": 1189.0,
          "completions/max_length": 5326.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3468.285888671875,
          "completions/min_terminated_length": 1189.0,
          "completions/max_terminated_length": 5326.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0476190485060215,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.516849160194397,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.3618776798248291,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.38490021228790283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6999523639678955,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1142006516456604,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7813174724578857,
          "reward_std": 0.40783098340034485,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.15408311132341623,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1369.1788975260133,
          "entropy_control/entropy": 0.18647065540602978,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1083.46247,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1131.564535,
          "forward_backward_time": 237.515248,
          "rollout_overhead_time": 48.102065,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125
        },
        {
          "step": 44,
          "loss": -0.18476806581020355,
          "grad_norm": 0.06787109375,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.15387438237667084,
          "clip_ratio/low_mean": 0.0006578518805326894,
          "clip_ratio/low_min": 0.0006578518805326894,
          "clip_ratio/high_mean": 0.0032520195527467877,
          "clip_ratio/high_max": 0.0032520195527467877,
          "clip_ratio/region_mean": 0.003909871433279477,
          "step_time": 237.64380487699964,
          "entropy_control/entropy": 0.18629113557588436,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 237.543046,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125,
          "reward": null
        },
        {
          "step": 45,
          "loss": -2.682209014892578e-07,
          "grad_norm": 0.0390625,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 725.63,
          "thinking/budget_hit_fraction": 0.2,
          "num_tokens": 1382070.0,
          "completions/mean_length": 3871.875,
          "completions/min_length": 1227.0,
          "completions/max_length": 6431.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3871.875,
          "completions/min_terminated_length": 1227.0,
          "completions/max_terminated_length": 6431.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.04545454680919647,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6812279224395752,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.05867519602179527,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.609315037727356,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8733965158462524,
          "reward_std": 0.05135876685380936,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2036501243710518,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1434.0196957680018,
          "entropy_control/entropy": 0.2165004215226099,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1191.264096,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1233.33525,
          "forward_backward_time": 200.578298,
          "rollout_overhead_time": 42.071154,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125
        },
        {
          "step": 46,
          "loss": 5.476176738739014e-05,
          "grad_norm": 0.037841796875,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.2035566046833992,
          "clip_ratio/low_mean": 0.00040974977309815586,
          "clip_ratio/low_min": 0.00040974977309815586,
          "clip_ratio/high_mean": 0.001062688126694411,
          "clip_ratio/high_max": 0.001062688126694411,
          "clip_ratio/region_mean": 0.001472437899792567,
          "step_time": 200.70870252800523,
          "entropy_control/entropy": 0.21648923488084992,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 200.608904,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125,
          "reward": null
        },
        {
          "step": 47,
          "loss": -4.172325134277344e-07,
          "grad_norm": 0.046630859375,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 683.1875,
          "thinking/budget_hit_fraction": 0.10416666666666667,
          "num_tokens": 1438712.0,
          "completions/mean_length": 3793.75,
          "completions/min_length": 1546.0,
          "completions/max_length": 6494.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3793.75,
          "completions/min_terminated_length": 1546.0,
          "completions/max_terminated_length": 6494.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6095432043075562,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8975076675415039,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08410575240850449,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9806088209152222,
          "reward_std": 0.15417182445526123,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21144754625856876,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1442.9635367679948,
          "entropy_control/entropy": 0.21850325503297707,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1180.318585,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1224.659429,
          "forward_backward_time": 218.205439,
          "rollout_overhead_time": 44.340844,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125
        },
        {
          "step": 48,
          "loss": 6.0051679611206055e-05,
          "grad_norm": 0.052978515625,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.2115715704858303,
          "clip_ratio/low_mean": 0.0006678483041469008,
          "clip_ratio/low_min": 0.0006678483041469008,
          "clip_ratio/high_mean": 0.0013030875124968588,
          "clip_ratio/high_max": 0.0013030875124968588,
          "clip_ratio/region_mean": 0.0019709358166437596,
          "step_time": 218.2718387430141,
          "entropy_control/entropy": 0.21860735752902272,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 218.176116,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125,
          "reward": null
        },
        {
          "step": 49,
          "loss": -1.7136335372924805e-07,
          "grad_norm": 0.11279296875,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 580.9702380952381,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 1497081.0,
          "completions/mean_length": 4005.125,
          "completions/min_length": 2847.0,
          "completions/max_length": 5514.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4005.125,
          "completions/min_terminated_length": 2847.0,
          "completions/max_terminated_length": 5514.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.03448275849223137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5439562201499939,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.20148904621601105,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8639028072357178,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07629269361495972,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.873721182346344,
          "reward_std": 0.3530108332633972,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20466671139001846,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1380.251024117999,
          "entropy_control/entropy": 0.2025214993560043,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 1092.512068,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1141.032596,
          "forward_backward_time": 239.117184,
          "rollout_overhead_time": 48.520527,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125
        },
        {
          "step": 50,
          "loss": 0.00019299983978271484,
          "grad_norm": 0.07568359375,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.20437165908515453,
          "clip_ratio/low_mean": 0.0019550809520296752,
          "clip_ratio/low_min": 0.0019550809520296752,
          "clip_ratio/high_mean": 0.0027724673855118454,
          "clip_ratio/high_max": 0.0027724673855118454,
          "clip_ratio/region_mean": 0.004727548337541521,
          "step_time": 239.17380329099979,
          "entropy_control/entropy": 0.20221694821805103,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 239.072435,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 69.07209730148315,
          "peak_reserved_gib": 76.8828125,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6401417781099434,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4513,
          "reward_channels": {
            "native": 0.6401417781099434,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5475,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3327,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3393,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8476409576243806,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 5539,
          "reward_channels": {
            "native": 0.8476409576243806,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2962,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1839,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1841,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3304,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8522045135672316,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4942,
          "reward_channels": {
            "native": 0.8522045135672316,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 5134,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3022,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3377,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3254,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.7060268919310104,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 2787,
          "reward_channels": {
            "native": 0.7060268919310104,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.9758783046350626,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 6212,
          "reward_channels": {
            "native": 0.9758783046350626,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.5924323165105192,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 6394,
          "reward_channels": {
            "native": 0.5924323165105192,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6185941887823871,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5493,
          "reward_channels": {
            "native": 0.6185941887823871,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5714,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.578198213067076,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5651,
          "reward_channels": {
            "native": 0.578198213067076,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8752709263462409,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6882,
          "reward_channels": {
            "native": 0.8752709263462409,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3306,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3741,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6512057439829095,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5034,
          "reward_channels": {
            "native": 0.6512057439829095,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1829,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8444084478162579,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2601,
          "reward_channels": {
            "native": 0.8444084478162579,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3139,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2258,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4289,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2965,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8461963597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 3414,
          "reward_channels": {
            "native": 0.8461963597959128,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4013,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3954,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8215681477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 9514,
          "reward_channels": {
            "native": 0.8215681477476042,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3702,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3163,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.9872132714354994,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 6563,
          "reward_channels": {
            "native": 0.9872132714354994,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2838,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3290,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789216886",
      "mode": "thinking",
      "method": "dapo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8035986447334289,
      "train_last10": 0.791574364900589,
      "holdout_native": 0.670334256205925,
      "holdout_episodes": 40,
      "holdout_successes": 38,
      "mean_step_seconds": 937.509529993039,
      "label": "DAPO",
      "state_at_cutoff": "complete",
      "step_hours": 13.020965694347764,
      "peak_allocated_gib": 66.51273250579834,
      "peak_reserved_gib": 73.994140625,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.670334256205925,
        "efficiency": 0.5083333333333334,
        "reliability": 0.9
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "c2042e6432234a101cef6be102e9ef2c79580b8b92ad8b9f7602bc39b3e1421e",
        "entropy_holdout_episodes.jsonl": "0276883c2f9922d2f9e877c478c6ae2ca44274aea2f492150e6ba5cbc3899f20",
        "resolved_training_config.json": "c926eec6dc33d3247dac92087f27e3f5926bd0a21a488fc60fda4ea9afcd61a4"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -0.32585203647613525,
          "grad_norm": 0.061279296875,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1292.0555840519999,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1101.067592,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1135.401235,
          "forward_backward_time": 156.55792,
          "rollout_overhead_time": 34.333643,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": -0.32607361674308777,
          "grad_norm": 0.06396484375,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14505659975111485,
          "clip_ratio/low_mean": 0.0004901283973595127,
          "clip_ratio/low_min": 0.0004901283973595127,
          "clip_ratio/high_mean": 0.0006680102596874349,
          "clip_ratio/high_max": 0.0006680102596874349,
          "clip_ratio/region_mean": 0.0011581386570469476,
          "step_time": 156.59421884200037,
          "entropy_control/entropy": 0.1996898505403954,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.489999,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": -0.2275024652481079,
          "grad_norm": 0.12109375,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 659.40625,
          "thinking/budget_hit_fraction": 0.15625,
          "num_tokens": 97103.0,
          "completions/mean_length": 2929.0,
          "completions/min_length": 1322.0,
          "completions/max_length": 4748.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 2908.71435546875,
          "completions/min_terminated_length": 1322.0,
          "completions/max_terminated_length": 4748.0,
          "tools/call_frequency": 1.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5617735385894775,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2409123331308365,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.23464767634868622,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7398985624313354,
          "reward_std": 0.38766199350357056,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16785027459263802,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 924.362896693,
          "entropy_control/entropy": 0.19792324347928317,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 802.354936,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 824.776987,
          "forward_backward_time": 99.481161,
          "rollout_overhead_time": 22.422051,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.494140625
        },
        {
          "step": 4,
          "loss": -0.22761014103889465,
          "grad_norm": 0.06298828125,
          "learning_rate": 9.4e-06,
          "entropy": 0.1675509177148342,
          "clip_ratio/low_mean": 0.0007690747879678383,
          "clip_ratio/low_min": 0.0007690747879678383,
          "clip_ratio/high_mean": 0.0011651632230496034,
          "clip_ratio/high_max": 0.0011651632230496034,
          "clip_ratio/region_mean": 0.0019342380110174417,
          "step_time": 99.59936518700079,
          "entropy_control/entropy": 0.1976198080155136,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 99.49852,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.494140625,
          "reward": null
        },
        {
          "step": 5,
          "loss": -0.1114804595708847,
          "grad_norm": 0.03857421875,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 771.9714285714286,
          "thinking/budget_hit_fraction": 0.2571428571428571,
          "num_tokens": 147204.0,
          "completions/mean_length": 3557.625,
          "completions/min_length": 2221.0,
          "completions/max_length": 5795.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3557.625,
          "completions/min_terminated_length": 2221.0,
          "completions/max_terminated_length": 5795.0,
          "tools/call_frequency": 2.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.562455415725708,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.24158011376857758,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.24800795316696167,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7395387291908264,
          "reward_std": 0.38718098402023315,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20901422388851643,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1064.131845978999,
          "entropy_control/entropy": 0.21309731888319075,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 885.447733,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 916.920766,
          "forward_backward_time": 147.10745,
          "rollout_overhead_time": 31.473034,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.494140625
        },
        {
          "step": 6,
          "loss": -0.11165289580821991,
          "grad_norm": 0.03955078125,
          "learning_rate": 9e-06,
          "entropy": 0.20917844772338867,
          "clip_ratio/low_mean": 0.0002251238183816895,
          "clip_ratio/low_min": 0.0002251238183816895,
          "clip_ratio/high_mean": 0.00043359493793104775,
          "clip_ratio/high_max": 0.00043359493793104775,
          "clip_ratio/region_mean": 0.0006587187563127372,
          "step_time": 147.21682394900108,
          "entropy_control/entropy": 0.2132870137415681,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 147.10944,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.494140625,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.051447492092847824,
          "grad_norm": 0.061279296875,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 600.5586734693878,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 213243.0,
          "completions/mean_length": 4787.375,
          "completions/min_length": 2629.0,
          "completions/max_length": 7505.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4787.375,
          "completions/min_terminated_length": 2629.0,
          "completions/max_terminated_length": 7505.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.03125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5704948902130127,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.21831679344177246,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.21516574919223785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.9053964614868164,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.09198641031980515,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.20971761643886566,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9056540131568909,
          "reward_std": 0.3700742721557617,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18943717889487743,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1984.3922040430007,
          "entropy_control/entropy": 0.1950053953556034,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1720.094763,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1765.746887,
          "forward_backward_time": 218.534155,
          "rollout_overhead_time": 45.652124,
          "peak_allocated_gib": 57.23006200790405,
          "peak_reserved_gib": 63.291015625
        },
        {
          "step": 8,
          "loss": -0.051317404955625534,
          "grad_norm": 0.056396484375,
          "learning_rate": 8.6e-06,
          "entropy": 0.18944677151739597,
          "clip_ratio/low_mean": 0.0008207407663576305,
          "clip_ratio/low_min": 0.0008207407663576305,
          "clip_ratio/high_mean": 0.0008121527353068814,
          "clip_ratio/high_max": 0.0008121527353068814,
          "clip_ratio/region_mean": 0.0016328935016645119,
          "step_time": 218.58815286200024,
          "entropy_control/entropy": 0.19497450350938475,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 218.490703,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 57.23006200790405,
          "peak_reserved_gib": 63.291015625,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.022280991077423096,
          "grad_norm": 0.053955078125,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 815.9724489795918,
          "thinking/budget_hit_fraction": 0.22448979591836735,
          "num_tokens": 280425.0,
          "completions/mean_length": 5113.75,
          "completions/min_length": 2215.0,
          "completions/max_length": 7902.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5113.75,
          "completions/min_terminated_length": 2215.0,
          "completions/max_terminated_length": 7902.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5167769193649292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.36239445209503174,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5882549285888672,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2566491961479187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.6712659001350403,
          "reward_std": 0.47680771350860596,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2029896266758442,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2095.5628474430023,
          "entropy_control/entropy": 0.20581572082624197,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1753.213057,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1810.901782,
          "forward_backward_time": 284.561784,
          "rollout_overhead_time": 57.688725,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 10,
          "loss": -0.02226249873638153,
          "grad_norm": 0.05419921875,
          "learning_rate": 8.2e-06,
          "entropy": 0.20288954116404057,
          "clip_ratio/low_mean": 0.0005352675216272473,
          "clip_ratio/low_min": 0.0005352675216272473,
          "clip_ratio/high_mean": 0.0006748229934601113,
          "clip_ratio/high_max": 0.0006748229934601113,
          "clip_ratio/region_mean": 0.0012100905150873587,
          "step_time": 284.6669807569997,
          "entropy_control/entropy": 0.20570136341666023,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 284.568336,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.0351431667804718,
          "grad_norm": 0.185546875,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 498.4304421768707,
          "thinking/budget_hit_fraction": 0.05612244897959184,
          "num_tokens": 337676.0,
          "completions/mean_length": 3847.375,
          "completions/min_length": 1208.0,
          "completions/max_length": 6759.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3847.375,
          "completions/min_terminated_length": 1208.0,
          "completions/max_terminated_length": 6759.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.17241379618644714,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5858154892921448,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.2379951924085617,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5218393802642822,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.354369193315506,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.6725773811340332,
          "reward_std": 0.4711439609527588,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1955870036035776,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1532.8431922100008,
          "entropy_control/entropy": 0.1943371465758466,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1264.596421,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1309.967144,
          "forward_backward_time": 222.770879,
          "rollout_overhead_time": 45.370723,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 12,
          "loss": 0.03544866666197777,
          "grad_norm": 0.068359375,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.19627046585083008,
          "clip_ratio/low_mean": 0.0003918922448065132,
          "clip_ratio/low_min": 0.0003918922448065132,
          "clip_ratio/high_mean": 0.0010237462411168963,
          "clip_ratio/high_max": 0.0010237462411168963,
          "clip_ratio/region_mean": 0.0014156384859234095,
          "step_time": 222.87849550399733,
          "entropy_control/entropy": 0.19470662796741972,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 222.775793,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.10882490873336792,
          "grad_norm": 0.052734375,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 602.0,
          "thinking/budget_hit_fraction": 0.16326530612244897,
          "num_tokens": 397832.0,
          "completions/mean_length": 4234.5,
          "completions/min_length": 2811.0,
          "completions/max_length": 6909.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4400.71435546875,
          "completions/min_terminated_length": 2811.0,
          "completions/max_terminated_length": 6909.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6766901016235352,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11402305960655212,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.36920472979545593,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.29988542199134827,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.6437807083129883,
          "reward_std": 0.4548361301422119,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18049024604260921,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1709.3426463319956,
          "entropy_control/entropy": 0.2073216940034155,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1414.950437,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1464.73315,
          "forward_backward_time": 244.505207,
          "rollout_overhead_time": 49.782713,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 14,
          "loss": -0.10887935757637024,
          "grad_norm": 0.052490234375,
          "learning_rate": 7.4e-06,
          "entropy": 0.18070777505636215,
          "clip_ratio/low_mean": 0.000984702754067257,
          "clip_ratio/low_min": 0.000984702754067257,
          "clip_ratio/high_mean": 0.0005047562153777108,
          "clip_ratio/high_max": 0.0005047562153777108,
          "clip_ratio/region_mean": 0.0014894589694449678,
          "step_time": 244.61136676099886,
          "entropy_control/entropy": 0.20755062122581508,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 244.510147,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.16348621249198914,
          "grad_norm": 0.04931640625,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 658.561507936508,
          "thinking/budget_hit_fraction": 0.1726190476190476,
          "num_tokens": 458862.0,
          "completions/mean_length": 4145.25,
          "completions/min_length": 2335.0,
          "completions/max_length": 6232.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4298.71435546875,
          "completions/min_terminated_length": 2335.0,
          "completions/max_terminated_length": 6232.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4855157732963562,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3275722563266754,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8572953343391418,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06820380687713623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8411972522735596,
          "reward_std": 0.4375230073928833,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16464687511324883,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1781.2970506860038,
          "entropy_control/entropy": 0.18991162269140954,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1512.930426,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1558.960194,
          "forward_backward_time": 222.230419,
          "rollout_overhead_time": 46.029767,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 16,
          "loss": -0.16334208846092224,
          "grad_norm": 0.047119140625,
          "learning_rate": 7e-06,
          "entropy": 0.1645781807601452,
          "clip_ratio/low_mean": 0.000881033978657797,
          "clip_ratio/low_min": 0.000881033978657797,
          "clip_ratio/high_mean": 0.0003130473469354911,
          "clip_ratio/high_max": 0.0003130473469354911,
          "clip_ratio/region_mean": 0.001194081325593288,
          "step_time": 222.34257325399994,
          "entropy_control/entropy": 0.1899335232739352,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 222.237415,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.2446298897266388,
          "grad_norm": 0.07373046875,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 652.5625,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 520614.0,
          "completions/mean_length": 4028.0,
          "completions/min_length": 2127.0,
          "completions/max_length": 6822.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4028.0,
          "completions/min_terminated_length": 2127.0,
          "completions/max_terminated_length": 6822.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7041756510734558,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12205106765031815,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6448794603347778,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07191970944404602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9005692005157471,
          "reward_std": 0.09277623146772385,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2022705264389515,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1728.3003051019969,
          "entropy_control/entropy": 0.2114883457479949,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1420.438021,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1472.093508,
          "forward_backward_time": 256.108781,
          "rollout_overhead_time": 51.655487,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 18,
          "loss": -0.24461257457733154,
          "grad_norm": 0.0751953125,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.20262296870350838,
          "clip_ratio/low_mean": 0.0012727567518595606,
          "clip_ratio/low_min": 0.0012727567518595606,
          "clip_ratio/high_mean": 0.000507575947267469,
          "clip_ratio/high_max": 0.000507575947267469,
          "clip_ratio/region_mean": 0.0017803326991270296,
          "step_time": 256.19080749199566,
          "entropy_control/entropy": 0.21171698209385525,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 256.088687,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 19,
          "loss": -0.234040305018425,
          "grad_norm": 0.046630859375,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 734.444246031746,
          "thinking/budget_hit_fraction": 0.1488095238095238,
          "num_tokens": 579366.0,
          "completions/mean_length": 4453.5,
          "completions/min_length": 3071.0,
          "completions/max_length": 5717.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4651.0,
          "completions/min_terminated_length": 3686.0,
          "completions/max_terminated_length": 5717.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.8162115812301636,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15060126781463623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6534296274185181,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.440314918756485,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.9035705924034119,
          "reward_std": 0.4581960141658783,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17671867087483406,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1768.9756165739927,
          "entropy_control/entropy": 0.20007666941078414,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1549.589429,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1587.335027,
          "forward_backward_time": 181.544711,
          "rollout_overhead_time": 37.745598,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 20,
          "loss": -0.23420467972755432,
          "grad_norm": 0.042236328125,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.17669420316815376,
          "clip_ratio/low_mean": 0.00015516385610681027,
          "clip_ratio/low_min": 0.00015516385610681027,
          "clip_ratio/high_mean": 0.000958040873229038,
          "clip_ratio/high_max": 0.000958040873229038,
          "clip_ratio/region_mean": 0.0011132047293358482,
          "step_time": 181.6321102799957,
          "entropy_control/entropy": 0.2000932475076012,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 181.533869,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 21,
          "loss": 0.15066727995872498,
          "grad_norm": 0.059814453125,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 873.0083333333334,
          "thinking/budget_hit_fraction": 0.275,
          "num_tokens": 647029.0,
          "completions/mean_length": 4758.875,
          "completions/min_length": 1426.0,
          "completions/max_length": 6865.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4758.875,
          "completions/min_terminated_length": 1426.0,
          "completions/max_terminated_length": 6865.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5967466831207275,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3003218472003937,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.09622503817081451,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.49323171377182007,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.33581945300102234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7668641805648804,
          "reward_std": 0.30521443486213684,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18542677350342274,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1774.4828627140014,
          "entropy_control/entropy": 0.1942894017855657,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1524.824504,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1568.056851,
          "forward_backward_time": 206.329051,
          "rollout_overhead_time": 43.232347,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 22,
          "loss": 0.1506814956665039,
          "grad_norm": 0.08056640625,
          "learning_rate": 5.8e-06,
          "entropy": 0.18549648858606815,
          "clip_ratio/low_mean": 0.00032234430545940995,
          "clip_ratio/low_min": 0.00032234430545940995,
          "clip_ratio/high_mean": 0.0012016383097943617,
          "clip_ratio/high_max": 0.0012016383097943617,
          "clip_ratio/region_mean": 0.0015239826152537717,
          "step_time": 206.42375343900858,
          "entropy_control/entropy": 0.19437401801192536,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 206.3231,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.1105230450630188,
          "grad_norm": 0.0732421875,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 549.9583333333334,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 702486.0,
          "completions/mean_length": 4046.625,
          "completions/min_length": 2702.0,
          "completions/max_length": 6388.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4046.625,
          "completions/min_terminated_length": 2702.0,
          "completions/max_terminated_length": 6388.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0714285746216774,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.735243558883667,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12735584378242493,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6815767288208008,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2877177894115448,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8813267350196838,
          "reward_std": 0.3490362763404846,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1694607101380825,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1365.9782649090012,
          "entropy_control/entropy": 0.16855090199562944,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1138.350714,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1178.007235,
          "forward_backward_time": 187.867558,
          "rollout_overhead_time": 39.65652,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 24,
          "loss": 0.11080944538116455,
          "grad_norm": 0.078125,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.16979407519102097,
          "clip_ratio/low_mean": 0.0008367355476366356,
          "clip_ratio/low_min": 0.0008367355476366356,
          "clip_ratio/high_mean": 0.0008138977864291519,
          "clip_ratio/high_max": 0.0008138977864291519,
          "clip_ratio/region_mean": 0.0016506333340657875,
          "step_time": 187.97036160500284,
          "entropy_control/entropy": 0.16893767577369181,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 187.866728,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.16266947984695435,
          "grad_norm": 0.059326171875,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 591.782142857143,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 761774.0,
          "completions/mean_length": 4321.0,
          "completions/min_length": 2464.0,
          "completions/max_length": 7546.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4321.0,
          "completions/min_terminated_length": 2464.0,
          "completions/max_terminated_length": 7546.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0357142873108387,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6715044975280762,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12447243928909302,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.8140208721160889,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.15102744102478027,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9646377563476562,
          "reward_std": 0.1373920887708664,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21843799017369747,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1797.1556359970018,
          "entropy_control/entropy": 0.2188761932152463,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1483.105186,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1535.716725,
          "forward_backward_time": 261.324729,
          "rollout_overhead_time": 52.611539,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 26,
          "loss": -0.16288836300373077,
          "grad_norm": 0.05712890625,
          "learning_rate": 5e-06,
          "entropy": 0.2184695415198803,
          "clip_ratio/low_mean": 0.0011264146414760035,
          "clip_ratio/low_min": 0.0011264146414760035,
          "clip_ratio/high_mean": 0.0004859872642555274,
          "clip_ratio/high_max": 0.0004859872642555274,
          "clip_ratio/region_mean": 0.0016124019057315309,
          "step_time": 261.40366287499273,
          "entropy_control/entropy": 0.2188503763701188,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 261.296295,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.0430377721786499,
          "grad_norm": 0.06689453125,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 558.719387755102,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 822946.0,
          "completions/mean_length": 4344.0,
          "completions/min_length": 1426.0,
          "completions/max_length": 5702.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4344.0,
          "completions/min_terminated_length": 1426.0,
          "completions/max_terminated_length": 5702.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.03703703731298447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7350375652313232,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.00234377384185791,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666567325592,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6625210046768188,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.32501402497291565,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9216959476470947,
          "reward_std": 0.21604451537132263,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2035625521093607,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1481.860717802003,
          "entropy_control/entropy": 0.20417728463592227,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1253.208215,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1293.051743,
          "forward_backward_time": 188.70501,
          "rollout_overhead_time": 39.843528,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 28,
          "loss": 0.04259427264332771,
          "grad_norm": 0.0625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.20379056967794895,
          "clip_ratio/low_mean": 0.0006127892702352256,
          "clip_ratio/low_min": 0.0006127892702352256,
          "clip_ratio/high_mean": 0.0014242628822103143,
          "clip_ratio/high_max": 0.0014242628822103143,
          "clip_ratio/region_mean": 0.00203705215244554,
          "step_time": 188.79422012899522,
          "entropy_control/entropy": 0.20432824070388717,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 188.689139,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.06107598915696144,
          "grad_norm": 0.05810546875,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 881.7666666666667,
          "thinking/budget_hit_fraction": 0.225,
          "num_tokens": 887927.0,
          "completions/mean_length": 4840.125,
          "completions/min_length": 3344.0,
          "completions/max_length": 6239.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4840.125,
          "completions/min_terminated_length": 3344.0,
          "completions/max_terminated_length": 6239.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.735346257686615,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.14634527266025543,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6439940333366394,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.05961908400058746,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.9136285185813904,
          "reward_std": 0.10964539647102356,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2220097780227661,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1548.6979675099974,
          "entropy_control/entropy": 0.2205613230403864,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1310.158924,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1351.849943,
          "forward_backward_time": 196.738621,
          "rollout_overhead_time": 41.69102,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 30,
          "loss": -0.06128338724374771,
          "grad_norm": 0.07568359375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.2213791236281395,
          "clip_ratio/low_mean": 0.001440455875126645,
          "clip_ratio/low_min": 0.001440455875126645,
          "clip_ratio/high_mean": 0.0003812400027527474,
          "clip_ratio/high_max": 0.0003812400027527474,
          "clip_ratio/region_mean": 0.0018216958778793924,
          "step_time": 196.82815311599916,
          "entropy_control/entropy": 0.2199646374989032,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 196.720821,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.11386636644601822,
          "grad_norm": 0.0966796875,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 698.3647959183673,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 959110.0,
          "completions/mean_length": 5814.375,
          "completions/min_length": 4186.0,
          "completions/max_length": 8945.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5814.375,
          "completions/min_terminated_length": 4186.0,
          "completions/max_terminated_length": 8945.0,
          "tools/call_frequency": 4.875,
          "tools/failure_frequency": 0.025641025975346565,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6564647555351257,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3634983003139496,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19416078925132751,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.9258201122283936,
          "reward": 0.7668814659118652,
          "reward_std": 0.5157641172409058,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1981115248054266,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2286.557038924999,
          "entropy_control/entropy": 0.205436449117097,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1983.012707,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2034.660368,
          "forward_backward_time": 251.791192,
          "rollout_overhead_time": 51.647661,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 32,
          "loss": 0.11421447992324829,
          "grad_norm": 0.054443359375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.19822406955063343,
          "clip_ratio/low_mean": 0.0005815364493173547,
          "clip_ratio/low_min": 0.0005815364493173547,
          "clip_ratio/high_mean": 0.0007530661969212815,
          "clip_ratio/high_max": 0.0007530661969212815,
          "clip_ratio/region_mean": 0.0013346026462386362,
          "step_time": 251.90113309199296,
          "entropy_control/entropy": 0.20553707141040561,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 251.799768,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.14891234040260315,
          "grad_norm": 0.0595703125,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 619.3869047619047,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1016174.0,
          "completions/mean_length": 4237.5,
          "completions/min_length": 2360.0,
          "completions/max_length": 6402.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4237.5,
          "completions/min_terminated_length": 2360.0,
          "completions/max_terminated_length": 6402.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7185772657394409,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.14374896883964539,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.9380024671554565,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07614614069461823,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0501649379730225,
          "reward_std": 0.15139304101467133,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19579855911433697,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1482.4170789929994,
          "entropy_control/entropy": 0.2025952334944647,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1207.180918,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1254.546605,
          "forward_backward_time": 227.772787,
          "rollout_overhead_time": 47.365687,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 34,
          "loss": -0.14863863587379456,
          "grad_norm": 0.0927734375,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.19608349725604057,
          "clip_ratio/low_mean": 0.0007156495121307671,
          "clip_ratio/low_min": 0.0007156495121307671,
          "clip_ratio/high_mean": 0.0005583660204138141,
          "clip_ratio/high_max": 0.0005583660204138141,
          "clip_ratio/region_mean": 0.0012740155325445812,
          "step_time": 227.86478610999984,
          "entropy_control/entropy": 0.202869317321604,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 227.768728,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.04887096956372261,
          "grad_norm": 0.05712890625,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 712.0357142857143,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1087844.0,
          "completions/mean_length": 5095.75,
          "completions/min_length": 3593.0,
          "completions/max_length": 6793.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5095.75,
          "completions/min_terminated_length": 3593.0,
          "completions/max_terminated_length": 6793.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6163443326950073,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.17312179505825043,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.29546844959259033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.7830110192298889,
          "reward_std": 0.3088133931159973,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21758883446455002,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2171.7106434480047,
          "entropy_control/entropy": 0.2166911986716076,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1843.603763,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1898.55651,
          "forward_backward_time": 273.057726,
          "rollout_overhead_time": 54.952747,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 36,
          "loss": 0.048965927213430405,
          "grad_norm": 0.05908203125,
          "learning_rate": 3e-06,
          "entropy": 0.2172426339238882,
          "clip_ratio/low_mean": 0.001170090981759131,
          "clip_ratio/low_min": 0.001170090981759131,
          "clip_ratio/high_mean": 0.0005635659981635399,
          "clip_ratio/high_max": 0.0005635659981635399,
          "clip_ratio/region_mean": 0.0017336569799226709,
          "step_time": 273.15497789299116,
          "entropy_control/entropy": 0.2163397982679518,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 273.059198,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.2859470844268799,
          "grad_norm": 0.072265625,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 703.547619047619,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 1146538.0,
          "completions/mean_length": 4456.75,
          "completions/min_length": 2812.0,
          "completions/max_length": 10325.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4456.75,
          "completions/min_terminated_length": 2812.0,
          "completions/max_terminated_length": 10325.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6686257123947144,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11784413456916809,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5488865971565247,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.2643485367298126,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.833756148815155,
          "reward_std": 0.20288874208927155,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19427929259836674,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2057.967392379993,
          "entropy_control/entropy": 0.19999829083888732,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 1740.651301,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1794.257522,
          "forward_backward_time": 263.603011,
          "rollout_overhead_time": 53.606221,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 38,
          "loss": 0.2857789993286133,
          "grad_norm": 0.0673828125,
          "learning_rate": 2.6e-06,
          "entropy": 0.19363762624561787,
          "clip_ratio/low_mean": 0.0006089746602810919,
          "clip_ratio/low_min": 0.0006089746602810919,
          "clip_ratio/high_mean": 0.0009969057573471218,
          "clip_ratio/high_max": 0.0009969057573471218,
          "clip_ratio/region_mean": 0.0016058804176282138,
          "step_time": 263.7077892659945,
          "entropy_control/entropy": 0.19954557126813618,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 263.605404,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.18318499624729156,
          "grad_norm": 0.064453125,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 547.4107142857143,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 1203755.0,
          "completions/mean_length": 4061.125,
          "completions/min_length": 2074.0,
          "completions/max_length": 7569.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4061.125,
          "completions/min_terminated_length": 2074.0,
          "completions/max_terminated_length": 7569.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.03448275849223137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7621634006500244,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.16878987848758698,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.9829967617988586,
          "reward_std": 0.15770334005355835,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17808955907821655,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1684.4528884049869,
          "entropy_control/entropy": 0.18310575210556304,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1443.224573,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1484.945297,
          "forward_backward_time": 199.402443,
          "rollout_overhead_time": 41.720724,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 40,
          "loss": -0.1832675337791443,
          "grad_norm": 0.064453125,
          "learning_rate": 2.2e-06,
          "entropy": 0.17827879264950752,
          "clip_ratio/low_mean": 0.0013926073152106255,
          "clip_ratio/low_min": 0.0013926073152106255,
          "clip_ratio/high_mean": 0.0004915288263873663,
          "clip_ratio/high_max": 0.0004915288263873663,
          "clip_ratio/region_mean": 0.0018841361415979918,
          "step_time": 199.50613806301408,
          "entropy_control/entropy": 0.18329289456727577,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 199.400434,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.22436562180519104,
          "grad_norm": 0.064453125,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 816.255,
          "thinking/budget_hit_fraction": 0.19,
          "num_tokens": 1262273.0,
          "completions/mean_length": 3837.75,
          "completions/min_length": 2457.0,
          "completions/max_length": 6153.0,
          "completions/clipped_ratio": 0.375,
          "completions/mean_terminated_length": 4297.80029296875,
          "completions/min_terminated_length": 2457.0,
          "completions/max_terminated_length": 6153.0,
          "tools/call_frequency": 2.0,
          "tools/failure_frequency": 0.0625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7159771919250488,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.08374388515949249,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.1552533656358719,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3105067312717438,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5012402534484863,
          "reward_std": 0.5839705467224121,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.12630949169397354,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1628.2348596299998,
          "entropy_control/entropy": 0.21240435895114057,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1406.627649,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1444.889648,
          "forward_backward_time": 183.246335,
          "rollout_overhead_time": 38.261999,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 42,
          "loss": -0.2244964838027954,
          "grad_norm": 0.0634765625,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.1261419951915741,
          "clip_ratio/low_mean": 0.0007117298082448542,
          "clip_ratio/low_min": 0.0007117298082448542,
          "clip_ratio/high_mean": 0.0006165484446682967,
          "clip_ratio/high_max": 0.0006165484446682967,
          "clip_ratio/region_mean": 0.001328278252913151,
          "step_time": 183.32331458000408,
          "entropy_control/entropy": 0.2120536675808387,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 183.226289,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.11457764357328415,
          "grad_norm": 0.06396484375,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 770.5678571428572,
          "thinking/budget_hit_fraction": 0.2,
          "num_tokens": 1321139.0,
          "completions/mean_length": 4054.25,
          "completions/min_length": 2686.0,
          "completions/max_length": 6287.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4054.25,
          "completions/min_terminated_length": 2686.0,
          "completions/max_terminated_length": 6287.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0476190485060215,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.4665586054325104,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.31143802404403687,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7308187484741211,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.09706426411867142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7716053128242493,
          "reward_std": 0.40083083510398865,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20480629988014698,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1231.5425371530146,
          "entropy_control/entropy": 0.20772306326729478,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1022.520319,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1058.76146,
          "forward_backward_time": 172.681923,
          "rollout_overhead_time": 36.241141,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625
        },
        {
          "step": 44,
          "loss": -0.11447513103485107,
          "grad_norm": 0.061279296875,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.2048952467739582,
          "clip_ratio/low_mean": 0.0006981215992709622,
          "clip_ratio/low_min": 0.0006981215992709622,
          "clip_ratio/high_mean": 0.0007196775623015128,
          "clip_ratio/high_max": 0.0007196775623015128,
          "clip_ratio/region_mean": 0.001417799161572475,
          "step_time": 172.76562454499071,
          "entropy_control/entropy": 0.20774115002095983,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 172.667739,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.42421674728394,
          "peak_reserved_gib": 73.916015625,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.08469386398792267,
          "grad_norm": 0.064453125,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 623.4416666666666,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 1387005.0,
          "completions/mean_length": 4563.25,
          "completions/min_length": 1985.0,
          "completions/max_length": 6768.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4563.25,
          "completions/min_terminated_length": 1985.0,
          "completions/max_terminated_length": 6768.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6128880977630615,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2622775435447693,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6322802305221558,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.045930415391922,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7913341522216797,
          "reward_std": 0.3092081546783447,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18784888088703156,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2018.4625300120024,
          "entropy_control/entropy": 0.18692615238509233,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1677.31727,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1734.556493,
          "forward_backward_time": 283.79525,
          "rollout_overhead_time": 57.239222,
          "peak_allocated_gib": 66.51273250579834,
          "peak_reserved_gib": 73.994140625
        },
        {
          "step": 46,
          "loss": -0.08453282713890076,
          "grad_norm": 0.06201171875,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.18786270171403885,
          "clip_ratio/low_mean": 0.001475626733736135,
          "clip_ratio/low_min": 0.001475626733736135,
          "clip_ratio/high_mean": 0.0003618006085162051,
          "clip_ratio/high_max": 0.0003618006085162051,
          "clip_ratio/region_mean": 0.0018374273422523402,
          "step_time": 283.93783065299067,
          "entropy_control/entropy": 0.18700232878490297,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 283.817246,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.51273250579834,
          "peak_reserved_gib": 73.994140625,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.17486082017421722,
          "grad_norm": 0.07373046875,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 694.2222222222222,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 1444322.0,
          "completions/mean_length": 3878.125,
          "completions/min_length": 1925.0,
          "completions/max_length": 5465.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3878.125,
          "completions/min_terminated_length": 1925.0,
          "completions/max_terminated_length": 5465.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6431146860122681,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0671430230140686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8646462559700012,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07877790927886963,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9820054769515991,
          "reward_std": 0.1320001631975174,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19449527747929096,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1601.3260191109875,
          "entropy_control/entropy": 0.19548352027935895,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1366.158659,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1406.71528,
          "forward_backward_time": 194.496634,
          "rollout_overhead_time": 40.556621,
          "peak_allocated_gib": 66.51273250579834,
          "peak_reserved_gib": 73.994140625
        },
        {
          "step": 48,
          "loss": -0.17461475729942322,
          "grad_norm": 0.07470703125,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.19404620304703712,
          "clip_ratio/low_mean": 0.0018585657380754128,
          "clip_ratio/low_min": 0.0018585657380754128,
          "clip_ratio/high_mean": 0.00026816325771505944,
          "clip_ratio/high_max": 0.00026816325771505944,
          "clip_ratio/region_mean": 0.0021267289957904723,
          "step_time": 194.61791170100332,
          "entropy_control/entropy": 0.19509070221750152,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 194.493542,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.51273250579834,
          "peak_reserved_gib": 73.994140625,
          "reward": null
        },
        {
          "step": 49,
          "loss": -0.1855476051568985,
          "grad_norm": 0.06201171875,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 498.35714285714283,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 1498068.0,
          "completions/mean_length": 3427.25,
          "completions/min_length": 1215.0,
          "completions/max_length": 5800.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3546.0,
          "completions/min_terminated_length": 1215.0,
          "completions/max_terminated_length": 5800.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.3669130802154541,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2973985970020294,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.38490021228790283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5094164609909058,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.45884740352630615,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.4527481198310852,
          "reward_std": 0.5826615691184998,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14470533467829227,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1525.5017623179883,
          "entropy_control/entropy": 0.20231896153053505,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 1270.81918,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1314.141797,
          "forward_backward_time": 211.25236,
          "rollout_overhead_time": 43.322618,
          "peak_allocated_gib": 66.51273250579834,
          "peak_reserved_gib": 73.994140625
        },
        {
          "step": 50,
          "loss": -0.18560901284217834,
          "grad_norm": 0.06396484375,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.14430952444672585,
          "clip_ratio/low_mean": 0.0010318411368643865,
          "clip_ratio/low_min": 0.0010318411368643865,
          "clip_ratio/high_mean": 0.000781740018283017,
          "clip_ratio/high_max": 0.000781740018283017,
          "clip_ratio/region_mean": 0.0018135811551474035,
          "step_time": 211.343559276007,
          "entropy_control/entropy": 0.20206067844582837,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 211.237227,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.51273250579834,
          "peak_reserved_gib": 73.994140625,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5833,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2844,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 3989,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5767,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2860,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4003,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2868,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3397,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2803,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8204653155141224,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5287,
          "reward_channels": {
            "native": 0.8204653155141224,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8204653155141224,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5805,
          "reward_channels": {
            "native": 0.8204653155141224,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 5849,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2883,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.9711908046350627,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5434,
          "reward_channels": {
            "native": 0.9711908046350627,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8541365354407209,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6366,
          "reward_channels": {
            "native": 0.8541365354407209,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4679,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4880,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.5798840889712712,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 7203,
          "reward_channels": {
            "native": 0.5798840889712712,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6098233982971253,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 8430,
          "reward_channels": {
            "native": 0.6098233982971253,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6512057439829095,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6466,
          "reward_channels": {
            "native": 0.6512057439829095,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.7140378233531887,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 7727,
          "reward_channels": {
            "native": 0.7140378233531887,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4801,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1426,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2317,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4209,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2922,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3818,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1444,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1463,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2396,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5561,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2562,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2742,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3740,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4736,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2434,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3641,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2804,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789271070",
      "mode": "thinking",
      "method": "dapo-refill",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8274829816818238,
      "train_last10": 0.856386661529541,
      "holdout_native": 0.7104741920786344,
      "holdout_episodes": 40,
      "holdout_successes": 38,
      "mean_step_seconds": 1015.5512065880799,
      "label": "DAPO-refill",
      "state_at_cutoff": "complete",
      "step_hours": 14.104877869278889,
      "peak_allocated_gib": 68.46192026138306,
      "peak_reserved_gib": 76.251953125,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.7104741920786344,
        "efficiency": 0.42083333333333334,
        "reliability": 0.9
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": true,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "10e45bd635ffe9b8c4953bfec377bbc2fc2c91edde6f226721bd4e2fb040caf6",
        "entropy_holdout_episodes.jsonl": "ebd77943f778dee4dac2d22e67ca07bf1117880221e5965ea787ec886e0d5d56",
        "resolved_training_config.json": "f94229355981ffb1a7c5d059a74bd06ded0fa98c4eddc5a9bb321408770f26d4"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -0.41404587030410767,
          "grad_norm": 0.078125,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1271.8538267409997,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1080.446999,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1114.965437,
          "forward_backward_time": 156.7967,
          "rollout_overhead_time": 34.518438,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": -0.4143061637878418,
          "grad_norm": 0.07763671875,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14520721696317196,
          "clip_ratio/low_mean": 0.0005725046212319285,
          "clip_ratio/low_min": 0.0005725046212319285,
          "clip_ratio/high_mean": 0.0005652937870763708,
          "clip_ratio/high_max": 0.0005652937870763708,
          "clip_ratio/region_mean": 0.0011377984083082993,
          "step_time": 156.81330739999976,
          "entropy_control/entropy": 0.19984217459147838,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.724333,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": -0.5281946063041687,
          "grad_norm": 0.059814453125,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 468.8392857142857,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 97984.0,
          "completions/mean_length": 3039.125,
          "completions/min_length": 1441.0,
          "completions/max_length": 4823.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3028.5,
          "completions/min_terminated_length": 1441.0,
          "completions/max_terminated_length": 4823.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.10526315867900848,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5148292779922485,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.33359119296073914,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3958333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3078019917011261,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.9258201122283936,
          "reward": 0.6346210241317749,
          "reward_std": 0.5233859419822693,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.13246088474988937,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1046.5687405200001,
          "entropy_control/entropy": 0.1794875835345148,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 852.482957,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 886.186538,
          "forward_backward_time": 160.289038,
          "rollout_overhead_time": 33.703581,
          "peak_allocated_gib": 48.180649280548096,
          "peak_reserved_gib": 53.22265625
        },
        {
          "step": 4,
          "loss": -0.52854323387146,
          "grad_norm": 0.057861328125,
          "learning_rate": 9.4e-06,
          "entropy": 0.13232495449483395,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0015268891293089837,
          "clip_ratio/high_max": 0.0015268891293089837,
          "clip_ratio/region_mean": 0.0015268891293089837,
          "step_time": 160.3931571160001,
          "entropy_control/entropy": 0.17936813542256924,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 160.299952,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 48.180649280548096,
          "peak_reserved_gib": 53.22265625,
          "reward": null
        },
        {
          "step": 5,
          "loss": -0.05710165947675705,
          "grad_norm": 0.07080078125,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 668.375,
          "thinking/budget_hit_fraction": 0.20833333333333334,
          "num_tokens": 152522.0,
          "completions/mean_length": 4112.25,
          "completions/min_length": 2754.0,
          "completions/max_length": 5956.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4112.25,
          "completions/min_terminated_length": 2754.0,
          "completions/max_terminated_length": 5956.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.680217981338501,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.10803307592868805,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.17251639068126678,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.9073012471199036,
          "reward_std": 0.10156676918268204,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20104767382144928,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1451.4844390130015,
          "entropy_control/entropy": 0.204112548446505,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 1262.375617,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1295.511743,
          "forward_backward_time": 155.879775,
          "rollout_overhead_time": 33.136126,
          "peak_allocated_gib": 48.180649280548096,
          "peak_reserved_gib": 53.22265625
        },
        {
          "step": 6,
          "loss": -0.057032063603401184,
          "grad_norm": 0.0673828125,
          "learning_rate": 9e-06,
          "entropy": 0.20102406851947308,
          "clip_ratio/low_mean": 0.0012988815578864887,
          "clip_ratio/low_min": 0.0012988815578864887,
          "clip_ratio/high_mean": 0.0004859589898842387,
          "clip_ratio/high_max": 0.0004859589898842387,
          "clip_ratio/region_mean": 0.0017848405477707274,
          "step_time": 155.96452493000015,
          "entropy_control/entropy": 0.20395353653773732,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 155.87106,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 48.180649280548096,
          "peak_reserved_gib": 53.22265625,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.0018136687576770782,
          "grad_norm": 0.056884765625,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 773.0738095238095,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 226566.0,
          "completions/mean_length": 5788.0,
          "completions/min_length": 3740.0,
          "completions/max_length": 7932.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5788.0,
          "completions/min_terminated_length": 3740.0,
          "completions/max_terminated_length": 7932.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6478960514068604,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2928895652294159,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8597946166992188,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06807643175125122,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9194703698158264,
          "reward_std": 0.3659683167934418,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19893752969801426,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2205.289949291002,
          "entropy_control/entropy": 0.19834686563335419,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1860.865076,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1919.055288,
          "forward_backward_time": 286.123635,
          "rollout_overhead_time": 58.190212,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875
        },
        {
          "step": 8,
          "loss": -0.0017804503440856934,
          "grad_norm": 0.05517578125,
          "learning_rate": 8.6e-06,
          "entropy": 0.1987463440746069,
          "clip_ratio/low_mean": 0.0012409407499944791,
          "clip_ratio/low_min": 0.0012409407499944791,
          "clip_ratio/high_mean": 0.0006047607457730919,
          "clip_ratio/high_max": 0.0006047607457730919,
          "clip_ratio/region_mean": 0.001845701495767571,
          "step_time": 286.1488141740001,
          "entropy_control/entropy": 0.19819089188407168,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 286.05478,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.39284372329711914,
          "grad_norm": 0.05810546875,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 834.1726190476189,
          "thinking/budget_hit_fraction": 0.12797619047619047,
          "num_tokens": 286150.0,
          "completions/mean_length": 4164.0,
          "completions/min_length": 2423.0,
          "completions/max_length": 7522.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4320.14306640625,
          "completions/min_terminated_length": 2423.0,
          "completions/max_terminated_length": 7522.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6691635251045227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11923417448997498,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5235523581504822,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.37063276767730713,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7671912908554077,
          "reward_std": 0.4060142934322357,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1782013326883316,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2210.013791121002,
          "entropy_control/entropy": 0.20875006682111244,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1868.719707,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1926.261481,
          "forward_backward_time": 283.632344,
          "rollout_overhead_time": 57.541774,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875
        },
        {
          "step": 10,
          "loss": -0.3931627869606018,
          "grad_norm": 0.0546875,
          "learning_rate": 8.2e-06,
          "entropy": 0.17814059741795063,
          "clip_ratio/low_mean": 0.0006339414248941466,
          "clip_ratio/low_min": 0.0006339414248941466,
          "clip_ratio/high_mean": 0.0006241699738893658,
          "clip_ratio/high_max": 0.0006241699738893658,
          "clip_ratio/region_mean": 0.0012581113987835124,
          "step_time": 283.73702334899826,
          "entropy_control/entropy": 0.208622635800752,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 283.621717,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.005036424845457077,
          "grad_norm": 0.060302734375,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 696.7291666666666,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 347781.0,
          "completions/mean_length": 4394.875,
          "completions/min_length": 3100.0,
          "completions/max_length": 6185.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4394.875,
          "completions/min_terminated_length": 3100.0,
          "completions/max_terminated_length": 6185.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.08695652335882187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5260480642318726,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.23834127187728882,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7017019987106323,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11484745144844055,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8420000076293945,
          "reward_std": 0.19645576179027557,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21366984024643898,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1592.7577740629968,
          "entropy_control/entropy": 0.21534860302940878,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1397.723132,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1431.749457,
          "forward_backward_time": 160.897133,
          "rollout_overhead_time": 34.026325,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875
        },
        {
          "step": 12,
          "loss": 0.005168553441762924,
          "grad_norm": 0.05859375,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.21324916929006577,
          "clip_ratio/low_mean": 0.0005457193256006576,
          "clip_ratio/low_min": 0.0005457193256006576,
          "clip_ratio/high_mean": 0.0005808843488921411,
          "clip_ratio/high_max": 0.0005808843488921411,
          "clip_ratio/region_mean": 0.0011266036744927987,
          "step_time": 161.014062000997,
          "entropy_control/entropy": 0.21491973479821413,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 160.90025,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875,
          "reward": null
        },
        {
          "step": 13,
          "loss": 0.09634605795145035,
          "grad_norm": 0.054443359375,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 853.588888888889,
          "thinking/budget_hit_fraction": 0.1875,
          "num_tokens": 415399.0,
          "completions/mean_length": 5167.25,
          "completions/min_length": 3056.0,
          "completions/max_length": 8148.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5167.25,
          "completions/min_terminated_length": 3056.0,
          "completions/max_terminated_length": 8148.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5009159445762634,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.21727728843688965,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7053016424179077,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12215055525302887,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957118570804596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8281087875366211,
          "reward_std": 0.19517196714878082,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2082820888608694,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2020.8756578060038,
          "entropy_control/entropy": 0.21198962241283884,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1687.421936,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1743.634275,
          "forward_backward_time": 277.123339,
          "rollout_overhead_time": 56.212338,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875
        },
        {
          "step": 14,
          "loss": 0.09629321098327637,
          "grad_norm": 0.053955078125,
          "learning_rate": 7.4e-06,
          "entropy": 0.20798952691257,
          "clip_ratio/low_mean": 0.0007254107185872272,
          "clip_ratio/low_min": 0.0007254107185872272,
          "clip_ratio/high_mean": 0.000983088102657348,
          "clip_ratio/high_max": 0.000983088102657348,
          "clip_ratio/region_mean": 0.001708498821244575,
          "step_time": 277.22948470600386,
          "entropy_control/entropy": 0.21172358444850858,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 277.117598,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.11289608478546143,
          "grad_norm": 0.1220703125,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 749.7755102040817,
          "thinking/budget_hit_fraction": 0.18367346938775508,
          "num_tokens": 486302.0,
          "completions/mean_length": 5379.375,
          "completions/min_length": 3071.0,
          "completions/max_length": 6517.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5709.14306640625,
          "completions/min_terminated_length": 3665.0,
          "completions/max_terminated_length": 6517.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6016470193862915,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2629297971725464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.4729248285293579,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4145148992538452,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.31549492478370667,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.59874427318573,
          "reward_std": 0.5368551015853882,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17465469613671303,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2361.7444208510024,
          "entropy_control/entropy": 0.19701933693096052,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 2046.550667,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2100.549428,
          "forward_backward_time": 261.095244,
          "rollout_overhead_time": 53.99876,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875
        },
        {
          "step": 16,
          "loss": -0.11281206458806992,
          "grad_norm": 0.06103515625,
          "learning_rate": 7e-06,
          "entropy": 0.1747240461409092,
          "clip_ratio/low_mean": 0.0004409278044477105,
          "clip_ratio/low_min": 0.0004409278044477105,
          "clip_ratio/high_mean": 0.000910558803298045,
          "clip_ratio/high_max": 0.000910558803298045,
          "clip_ratio/region_mean": 0.0013514866077457555,
          "step_time": 261.20766560401535,
          "entropy_control/entropy": 0.19709243253552391,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 261.095538,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.19307515025138855,
          "grad_norm": 0.0673828125,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 528.0034013605442,
          "thinking/budget_hit_fraction": 0.09183673469387754,
          "num_tokens": 547833.0,
          "completions/mean_length": 4000.375,
          "completions/min_length": 2373.0,
          "completions/max_length": 6010.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4133.14306640625,
          "completions/min_terminated_length": 2373.0,
          "completions/max_terminated_length": 6010.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.03703703731298447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7049051523208618,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12004125118255615,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5523415207862854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.38071539998054504,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.7952899932861328,
          "reward_std": 0.4147125780582428,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18406094796955585,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1937.928044410004,
          "entropy_control/entropy": 0.20794299019123733,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1653.924235,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1702.590113,
          "forward_backward_time": 235.219332,
          "rollout_overhead_time": 48.665879,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875
        },
        {
          "step": 18,
          "loss": -0.1930653303861618,
          "grad_norm": 0.0693359375,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.1838545147329569,
          "clip_ratio/low_mean": 0.0007282581645995378,
          "clip_ratio/low_min": 0.0007282581645995378,
          "clip_ratio/high_mean": 0.0007973067622515373,
          "clip_ratio/high_max": 0.0007973067622515373,
          "clip_ratio/region_mean": 0.0015255649268510751,
          "step_time": 235.31410456199956,
          "entropy_control/entropy": 0.2076618631034234,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 235.201377,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.21875,
          "reward": null
        },
        {
          "step": 19,
          "loss": -0.07311653345823288,
          "grad_norm": 0.06884765625,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 667.5,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 600513.0,
          "completions/mean_length": 3694.5,
          "completions/min_length": 1339.0,
          "completions/max_length": 5164.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3694.5,
          "completions/min_terminated_length": 1339.0,
          "completions/max_terminated_length": 5164.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6101748943328857,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.025337064638733864,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8939128518104553,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07854292541742325,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9780855178833008,
          "reward_std": 0.15884076058864594,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19092376343905926,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1460.218944550994,
          "entropy_control/entropy": 0.19918622018720106,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1302.994384,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1331.426936,
          "forward_backward_time": 128.675874,
          "rollout_overhead_time": 28.432553,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 20,
          "loss": -0.0731862410902977,
          "grad_norm": 0.06787109375,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.1917433701455593,
          "clip_ratio/low_mean": 0.0005687122466042638,
          "clip_ratio/low_min": 0.0005687122466042638,
          "clip_ratio/high_mean": 0.0010158204386243597,
          "clip_ratio/high_max": 0.0010158204386243597,
          "clip_ratio/region_mean": 0.0015845326852286234,
          "step_time": 128.79446079900663,
          "entropy_control/entropy": 0.20005662801063512,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 128.68168,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.13835109770298004,
          "grad_norm": 0.05908203125,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 742.0208333333334,
          "thinking/budget_hit_fraction": 0.20833333333333334,
          "num_tokens": 668260.0,
          "completions/mean_length": 4769.375,
          "completions/min_length": 2701.0,
          "completions/max_length": 7890.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4769.375,
          "completions/min_terminated_length": 2701.0,
          "completions/max_terminated_length": 7890.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6688806414604187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.06329096108675003,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957118570804596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6173508167266846,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.015867799520492554,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8681157231330872,
          "reward_std": 0.043037109076976776,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19520873576402664,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2067.7043030540044,
          "entropy_control/entropy": 0.20241929057839275,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1738.580876,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1794.518201,
          "forward_backward_time": 273.082422,
          "rollout_overhead_time": 55.937325,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 22,
          "loss": -0.13812217116355896,
          "grad_norm": 0.059814453125,
          "learning_rate": 5.8e-06,
          "entropy": 0.19527459517121315,
          "clip_ratio/low_mean": 0.0012276367633603513,
          "clip_ratio/low_min": 0.0012276367633603513,
          "clip_ratio/high_mean": 0.0003591680942918174,
          "clip_ratio/high_max": 0.0003591680942918174,
          "clip_ratio/region_mean": 0.0015868048576521687,
          "step_time": 273.1928589199997,
          "entropy_control/entropy": 0.20245840756560973,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 273.088669,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 23,
          "loss": -0.2540090084075928,
          "grad_norm": 0.07177734375,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 695.7666666666667,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 721754.0,
          "completions/mean_length": 3801.25,
          "completions/min_length": 2753.0,
          "completions/max_length": 6114.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3801.25,
          "completions/min_terminated_length": 2753.0,
          "completions/max_terminated_length": 6114.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6682802438735962,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11743566393852234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8659225702285767,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08097398281097412,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9962680339813232,
          "reward_std": 0.1374383568763733,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1908215843141079,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1290.6729723049975,
          "entropy_control/entropy": 0.18894690473745326,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1098.338165,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1131.757219,
          "forward_backward_time": 158.801012,
          "rollout_overhead_time": 33.419053,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 24,
          "loss": -0.25433793663978577,
          "grad_norm": 0.0693359375,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.1907775029540062,
          "clip_ratio/low_mean": 0.0015442325093317777,
          "clip_ratio/low_min": 0.0015442325093317777,
          "clip_ratio/high_mean": 0.0001226692838827148,
          "clip_ratio/high_max": 0.0001226692838827148,
          "clip_ratio/region_mean": 0.0016669017932144925,
          "step_time": 158.91810345100748,
          "entropy_control/entropy": 0.18890588621257712,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 158.800509,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.3781495988368988,
          "grad_norm": 0.0703125,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 569.3003401360544,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 779184.0,
          "completions/mean_length": 4088.75,
          "completions/min_length": 1462.0,
          "completions/max_length": 6761.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4234.14306640625,
          "completions/min_terminated_length": 1462.0,
          "completions/max_terminated_length": 6761.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7392415404319763,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13263945281505585,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.40354466438293457,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.34268611669540405,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.154700517654419,
          "reward": 0.6849347352981567,
          "reward_std": 0.48197078704833984,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16409864276647568,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1867.9587041330087,
          "entropy_control/entropy": 0.19068812964328846,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1560.219861,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1612.384982,
          "forward_backward_time": 255.480551,
          "rollout_overhead_time": 52.165122,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 26,
          "loss": -0.37836676836013794,
          "grad_norm": 0.06396484375,
          "learning_rate": 5e-06,
          "entropy": 0.16466358676552773,
          "clip_ratio/low_mean": 0.0010647143644746393,
          "clip_ratio/low_min": 0.0010647143644746393,
          "clip_ratio/high_mean": 0.0006297622821875848,
          "clip_ratio/high_max": 0.0006297622821875848,
          "clip_ratio/region_mean": 0.001694476646662224,
          "step_time": 255.583496878,
          "entropy_control/entropy": 0.19107552944040063,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 255.474175,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 27,
          "loss": -0.25493109226226807,
          "grad_norm": 0.07666015625,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 594.0025510204081,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 835601.0,
          "completions/mean_length": 3749.625,
          "completions/min_length": 1408.0,
          "completions/max_length": 5843.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3749.625,
          "completions/min_terminated_length": 1408.0,
          "completions/max_terminated_length": 5843.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.08695652335882187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6414066553115845,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.06320184469223022,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6505849361419678,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4378522038459778,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8178707957267761,
          "reward_std": 0.4275791347026825,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17324734199792147,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1640.3296975979974,
          "entropy_control/entropy": 0.17818871078912338,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1342.781024,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1392.775115,
          "forward_backward_time": 247.44297,
          "rollout_overhead_time": 49.994092,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 28,
          "loss": -0.2548600435256958,
          "grad_norm": 0.06884765625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.1727202758193016,
          "clip_ratio/low_mean": 0.0009054355468833819,
          "clip_ratio/low_min": 0.0009054355468833819,
          "clip_ratio/high_mean": 0.000712330816895701,
          "clip_ratio/high_max": 0.000712330816895701,
          "clip_ratio/region_mean": 0.001617766363779083,
          "step_time": 247.52918564000356,
          "entropy_control/entropy": 0.17790918098791764,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 247.419597,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.07595027983188629,
          "grad_norm": 0.059326171875,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 665.0119047619047,
          "thinking/budget_hit_fraction": 0.19642857142857142,
          "num_tokens": 902322.0,
          "completions/mean_length": 5057.625,
          "completions/min_length": 2928.0,
          "completions/max_length": 6352.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5057.625,
          "completions/min_terminated_length": 2928.0,
          "completions/max_terminated_length": 6352.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.06451612710952759,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6719769239425659,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12673872709274292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5428180694580078,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2034512609243393,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.21516574919223785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7771891355514526,
          "reward_std": 0.30675458908081055,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.22062398493289948,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1969.6545821579966,
          "entropy_control/entropy": 0.2188746276922711,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1677.420093,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1727.592026,
          "forward_backward_time": 241.949094,
          "rollout_overhead_time": 50.171933,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 30,
          "loss": -0.07589748501777649,
          "grad_norm": 0.0595703125,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.22067385911941528,
          "clip_ratio/low_mean": 0.0010641067347023636,
          "clip_ratio/low_min": 0.0010641067347023636,
          "clip_ratio/high_mean": 0.0005229517410043627,
          "clip_ratio/high_max": 0.0005229517410043627,
          "clip_ratio/region_mean": 0.0015870584757067263,
          "step_time": 242.06835631800277,
          "entropy_control/entropy": 0.21898990172933744,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 241.95705,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 31,
          "loss": -0.05214519053697586,
          "grad_norm": 0.078125,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 667.8375850340136,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 967693.0,
          "completions/mean_length": 5087.875,
          "completions/min_length": 2771.0,
          "completions/max_length": 7788.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4702.14306640625,
          "completions/min_terminated_length": 2771.0,
          "completions/max_terminated_length": 7074.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.03125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6885681748390198,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.29825878143310547,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3541666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2077372521162033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.8562765121459961,
          "reward_std": 0.4053352475166321,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1631258949637413,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2172.747359213983,
          "entropy_control/entropy": 0.18656705000969062,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1868.67497,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1919.549486,
          "forward_backward_time": 253.084808,
          "rollout_overhead_time": 50.874516,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 32,
          "loss": -0.05206791311502457,
          "grad_norm": 0.0625,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.1631073895841837,
          "clip_ratio/low_mean": 0.0007781426684232429,
          "clip_ratio/low_min": 0.0007781426684232429,
          "clip_ratio/high_mean": 0.0006902424938743934,
          "clip_ratio/high_max": 0.0006902424938743934,
          "clip_ratio/region_mean": 0.0014683851622976363,
          "step_time": 253.1972244689896,
          "entropy_control/entropy": 0.18660941503527725,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 253.085928,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.1136540025472641,
          "grad_norm": 0.0625,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 555.125,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1022886.0,
          "completions/mean_length": 4003.625,
          "completions/min_length": 2284.0,
          "completions/max_length": 6209.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4003.625,
          "completions/min_terminated_length": 2284.0,
          "completions/max_terminated_length": 6209.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.07407407462596893,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6746612787246704,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.10988383740186691,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5187197923660278,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3549153804779053,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.7706488370895386,
          "reward_std": 0.3620922863483429,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19170449674129486,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1623.1493520590084,
          "entropy_control/entropy": 0.1938683924069639,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1411.504947,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1448.883133,
          "forward_backward_time": 174.159315,
          "rollout_overhead_time": 37.378186,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375
        },
        {
          "step": 34,
          "loss": 0.11371944844722748,
          "grad_norm": 0.0673828125,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.19164535589516163,
          "clip_ratio/low_mean": 0.0013614757772302255,
          "clip_ratio/low_min": 0.0013614757772302255,
          "clip_ratio/high_mean": 0.0004331821473897435,
          "clip_ratio/high_max": 0.0004331821473897435,
          "clip_ratio/region_mean": 0.001794657924619969,
          "step_time": 174.2861271330039,
          "entropy_control/entropy": 0.1939651095572516,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 174.170299,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.74047183990479,
          "peak_reserved_gib": 74.240234375,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.32272768020629883,
          "grad_norm": 0.058837890625,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 756.1493197278912,
          "thinking/budget_hit_fraction": 0.14795918367346936,
          "num_tokens": 1093376.0,
          "completions/mean_length": 4948.25,
          "completions/min_length": 2220.0,
          "completions/max_length": 7897.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5216.4287109375,
          "completions/min_terminated_length": 2220.0,
          "completions/max_terminated_length": 7897.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5765712261199951,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.25050315260887146,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3012869358062744,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.7421962022781372,
          "reward_std": 0.39045342803001404,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17574194259941578,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2223.7072799999805,
          "entropy_control/entropy": 0.2012081827944982,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1863.796411,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1924.116497,
          "forward_backward_time": 299.476099,
          "rollout_overhead_time": 60.320086,
          "peak_allocated_gib": 68.41224241256714,
          "peak_reserved_gib": 76.193359375
        },
        {
          "step": 36,
          "loss": -0.3228744566440582,
          "grad_norm": 0.050048828125,
          "learning_rate": 3e-06,
          "entropy": 0.17565468326210976,
          "clip_ratio/low_mean": 0.0007310346118174493,
          "clip_ratio/low_min": 0.0007310346118174493,
          "clip_ratio/high_mean": 0.0003735209902515635,
          "clip_ratio/high_max": 0.0003735209902515635,
          "clip_ratio/region_mean": 0.0011045556020690128,
          "step_time": 299.5672293989919,
          "entropy_control/entropy": 0.201147767312505,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 299.46275,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.41224241256714,
          "peak_reserved_gib": 76.193359375,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.17068979144096375,
          "grad_norm": 0.07861328125,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 513.6964285714286,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 1145984.0,
          "completions/mean_length": 3696.0,
          "completions/min_length": 1549.0,
          "completions/max_length": 5708.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3696.0,
          "completions/min_terminated_length": 1549.0,
          "completions/max_terminated_length": 5708.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.08695652335882187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7275477647781372,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13607469201087952,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.656780481338501,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0910348892211914,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.920289158821106,
          "reward_std": 0.1074429303407669,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20684580318629742,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1281.9606787930024,
          "entropy_control/entropy": 0.2127551682690933,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 1059.999023,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1098.757953,
          "forward_backward_time": 183.087473,
          "rollout_overhead_time": 38.75893,
          "peak_allocated_gib": 68.41224241256714,
          "peak_reserved_gib": 76.193359375
        },
        {
          "step": 38,
          "loss": -0.17084544897079468,
          "grad_norm": 0.07421875,
          "learning_rate": 2.6e-06,
          "entropy": 0.207224877551198,
          "clip_ratio/low_mean": 0.0018302314565517008,
          "clip_ratio/low_min": 0.0018302314565517008,
          "clip_ratio/high_mean": 0.0003249518049415201,
          "clip_ratio/high_max": 0.0003249518049415201,
          "clip_ratio/region_mean": 0.002155183261493221,
          "step_time": 183.18254053301644,
          "entropy_control/entropy": 0.21309143610341108,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 183.082426,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.41224241256714,
          "peak_reserved_gib": 76.193359375,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.09496024250984192,
          "grad_norm": 0.046875,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 690.9642857142857,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1211456.0,
          "completions/mean_length": 5093.0,
          "completions/min_length": 3470.0,
          "completions/max_length": 7826.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5093.0,
          "completions/min_terminated_length": 3470.0,
          "completions/max_terminated_length": 7826.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.03333333507180214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7511086463928223,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0961092934012413,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3958333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.23464767634868622,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.970900297164917,
          "reward_std": 0.0874413251876831,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21844188123941422,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1925.603753813979,
          "entropy_control/entropy": 0.2150383363867733,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1614.123999,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1667.01614,
          "forward_backward_time": 258.482786,
          "rollout_overhead_time": 52.892141,
          "peak_allocated_gib": 68.41224241256714,
          "peak_reserved_gib": 76.193359375
        },
        {
          "step": 40,
          "loss": -0.0950980931520462,
          "grad_norm": 0.046142578125,
          "learning_rate": 2.2e-06,
          "entropy": 0.21833787113428116,
          "clip_ratio/low_mean": 0.0007938431372167543,
          "clip_ratio/low_min": 0.0007938431372167543,
          "clip_ratio/high_mean": 0.0005773864177172072,
          "clip_ratio/high_max": 0.0005773864177172072,
          "clip_ratio/region_mean": 0.0013712295549339615,
          "step_time": 258.53294155299955,
          "entropy_control/entropy": 0.2149255913309748,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 258.42222,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.41224241256714,
          "peak_reserved_gib": 76.193359375,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.1262494921684265,
          "grad_norm": 0.057373046875,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 679.2714285714285,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 1279842.0,
          "completions/mean_length": 5071.25,
          "completions/min_length": 2665.0,
          "completions/max_length": 8500.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5071.25,
          "completions/min_terminated_length": 2665.0,
          "completions/max_terminated_length": 8500.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.643683910369873,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.34630754590034485,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7062281370162964,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.34980955719947815,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.8416227102279663,
          "reward_std": 0.4144892990589142,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19727547280490398,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2245.0404615720036,
          "entropy_control/entropy": 0.20188952450310807,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1885.256483,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1945.812313,
          "forward_backward_time": 299.114605,
          "rollout_overhead_time": 60.555831,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125
        },
        {
          "step": 42,
          "loss": 0.12635992467403412,
          "grad_norm": 0.05859375,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.1972111500799656,
          "clip_ratio/low_mean": 0.0007892334251664579,
          "clip_ratio/low_min": 0.0007892334251664579,
          "clip_ratio/high_mean": 0.0006546082731802016,
          "clip_ratio/high_max": 0.0006546082731802016,
          "clip_ratio/region_mean": 0.0014438416983466595,
          "step_time": 299.2247267749917,
          "entropy_control/entropy": 0.2018908316259224,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 299.11161,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.05368418991565704,
          "grad_norm": 0.061767578125,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 576.9719387755102,
          "thinking/budget_hit_fraction": 0.05357142857142857,
          "num_tokens": 1342394.0,
          "completions/mean_length": 4515.0,
          "completions/min_length": 2961.0,
          "completions/max_length": 7979.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4515.0,
          "completions/min_terminated_length": 2961.0,
          "completions/max_terminated_length": 7979.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7894160747528076,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.09969109296798706,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7056864500045776,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.10593900829553604,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9652596116065979,
          "reward_std": 0.10003283619880676,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19226796738803387,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2151.2987192989967,
          "entropy_control/entropy": 0.19243019402606767,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1836.32729,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1890.224049,
          "forward_backward_time": 260.972588,
          "rollout_overhead_time": 53.896759,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125
        },
        {
          "step": 44,
          "loss": -0.053502753376960754,
          "grad_norm": 0.06103515625,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.19260794669389725,
          "clip_ratio/low_mean": 0.0012998088932363316,
          "clip_ratio/low_min": 0.0012998088932363316,
          "clip_ratio/high_mean": 0.0004901139982393943,
          "clip_ratio/high_max": 0.0004901139982393943,
          "clip_ratio/region_mean": 0.001789922891475726,
          "step_time": 261.0669290939986,
          "entropy_control/entropy": 0.19283728370264044,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 260.963191,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.355094313621521,
          "grad_norm": 0.056640625,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 628.6498015873016,
          "thinking/budget_hit_fraction": 0.1755952380952381,
          "num_tokens": 1405039.0,
          "completions/mean_length": 4160.625,
          "completions/min_length": 2181.0,
          "completions/max_length": 6990.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4316.2861328125,
          "completions/min_terminated_length": 2181.0,
          "completions/max_terminated_length": 6990.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.07407407462596893,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5175503492355347,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.34920167922973633,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6731905341148376,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07375707477331161,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7630787491798401,
          "reward_std": 0.3925502300262451,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14445575140416622,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1828.9440834909983,
          "entropy_control/entropy": 0.1795795040736851,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1522.479237,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1574.986152,
          "forward_backward_time": 253.863638,
          "rollout_overhead_time": 52.506915,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125
        },
        {
          "step": 46,
          "loss": -0.3554255962371826,
          "grad_norm": 0.058837890625,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.14436963014304638,
          "clip_ratio/low_mean": 0.0007786930655129254,
          "clip_ratio/low_min": 0.0007786930655129254,
          "clip_ratio/high_mean": 0.0010567690624156967,
          "clip_ratio/high_max": 0.0010567690624156967,
          "clip_ratio/region_mean": 0.001835462127928622,
          "step_time": 253.96728759899997,
          "entropy_control/entropy": 0.17943839526184938,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 253.87415,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.2797643542289734,
          "grad_norm": 0.07373046875,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 706.6880952380952,
          "thinking/budget_hit_fraction": 0.20357142857142857,
          "num_tokens": 1460341.0,
          "completions/mean_length": 3626.25,
          "completions/min_length": 2777.0,
          "completions/max_length": 5604.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3705.571533203125,
          "completions/min_terminated_length": 2777.0,
          "completions/max_terminated_length": 5604.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0555555559694767,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6685474514961243,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11800849437713623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45637863874435425,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4318944215774536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.7385047674179077,
          "reward_std": 0.4371601641178131,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16909927129745483,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1298.146168375999,
          "entropy_control/entropy": 0.19756781492478873,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1092.833734,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1129.068102,
          "forward_backward_time": 168.976474,
          "rollout_overhead_time": 36.234368,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125
        },
        {
          "step": 48,
          "loss": -0.27966615557670593,
          "grad_norm": 0.06982421875,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.1692350823432207,
          "clip_ratio/low_mean": 0.001093564831535332,
          "clip_ratio/low_min": 0.001093564831535332,
          "clip_ratio/high_mean": 0.00047645412269048393,
          "clip_ratio/high_max": 0.00047645412269048393,
          "clip_ratio/region_mean": 0.0015700189542258158,
          "step_time": 169.10284090100322,
          "entropy_control/entropy": 0.1977788357877354,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 169.004128,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.017329305410385132,
          "grad_norm": 0.06884765625,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 594.172619047619,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 1520047.0,
          "completions/mean_length": 4172.25,
          "completions/min_length": 1384.0,
          "completions/max_length": 7241.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4172.25,
          "completions/min_terminated_length": 1384.0,
          "completions/max_terminated_length": 7241.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0357142873108387,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7230167388916016,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.13191144168376923,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8234126567840576,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.004687488079071045,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9950897693634033,
          "reward_std": 0.09558027237653732,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18376885168254375,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1922.4227069150002,
          "entropy_control/entropy": 0.19315520377796397,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 1594.478549,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1648.977091,
          "forward_backward_time": 273.338029,
          "rollout_overhead_time": 54.498542,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125
        },
        {
          "step": 50,
          "loss": 0.017506033182144165,
          "grad_norm": 0.072265625,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.18357139453291893,
          "clip_ratio/low_mean": 0.0009963576740119606,
          "clip_ratio/low_min": 0.0009963576740119606,
          "clip_ratio/high_mean": 0.0009350554882985307,
          "clip_ratio/high_max": 0.0009350554882985307,
          "clip_ratio/region_mean": 0.0019314131623104913,
          "step_time": 273.44746495200525,
          "entropy_control/entropy": 0.19305243055411617,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 273.334569,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.46192026138306,
          "peak_reserved_gib": 76.251953125,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2542,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8404385754973732,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3328,
          "reward_channels": {
            "native": 0.8404385754973732,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8404385754973732,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4721,
          "reward_channels": {
            "native": 0.8404385754973732,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2496,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3384,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3318,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 911,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3254,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8204653155141224,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 2445,
          "reward_channels": {
            "native": 0.8204653155141224,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3217,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8428295135672316,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 6975,
          "reward_channels": {
            "native": 0.8428295135672316,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8522045135672316,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3920,
          "reward_channels": {
            "native": 0.8522045135672316,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.7060268919310104,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5330,
          "reward_channels": {
            "native": 0.7060268919310104,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.811786874720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 1901,
          "reward_channels": {
            "native": 0.811786874720879,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.807099374720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 4850,
          "reward_channels": {
            "native": 0.807099374720879,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.811786874720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5110,
          "reward_channels": {
            "native": 0.811786874720879,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6185941887823871,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 7543,
          "reward_channels": {
            "native": 0.6185941887823871,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6502053079500402,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4105,
          "reward_channels": {
            "native": 0.6502053079500402,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8720485688510347,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5804,
          "reward_channels": {
            "native": 0.8720485688510347,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4088,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.7053628099527464,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5401,
          "reward_channels": {
            "native": 0.7053628099527464,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6959878099527463,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 7482,
          "reward_channels": {
            "native": 0.6959878099527463,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6051358982971253,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 6933,
          "reward_channels": {
            "native": 0.6051358982971253,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6053090928016737,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 8546,
          "reward_channels": {
            "native": 0.6053090928016737,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.7456673418171573,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 6103,
          "reward_channels": {
            "native": 0.7456673418171573,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6412222518441313,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5299,
          "reward_channels": {
            "native": 0.6412222518441313,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1392,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.7503548418171574,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3231,
          "reward_channels": {
            "native": 0.7503548418171574,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5252,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3015,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5040,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4438,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.962057681977345,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5392,
          "reward_channels": {
            "native": 0.962057681977345,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4431,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4198,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3091,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.9513407572618797,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 6078,
          "reward_channels": {
            "native": 0.9513407572618797,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3898,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.9829802732091317,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 4624,
          "reward_channels": {
            "native": 0.9829802732091317,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.9069421616294167,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 6983,
          "reward_channels": {
            "native": 0.9069421616294167,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789273322",
      "mode": "thinking",
      "method": "gdpo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8190012788772583,
      "train_last10": 0.8253489136695862,
      "holdout_native": 0.6601590534180904,
      "holdout_episodes": 40,
      "holdout_successes": 35,
      "mean_step_seconds": 937.89942124912,
      "label": "GDPO",
      "state_at_cutoff": "complete",
      "step_hours": 13.026380850682221,
      "peak_allocated_gib": 68.30920124053955,
      "peak_reserved_gib": 76.08203125,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.6601590534180904,
        "efficiency": 0.4625,
        "reliability": 0.85
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "gdpo",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "2c412be9b59e031efa49d7d0802b2c45d2f0a0173d593018df248c13770c9742",
        "entropy_holdout_episodes.jsonl": "19c1153be62ef5b60bdfa4d9b235db785888e26e652783f95a5ebcd6b1348ed6",
        "resolved_training_config.json": "77d3d9071a4f6d59362223862c015a4cf5c477ca1247fca7eac9140caa5ae09d"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -0.36769813299179077,
          "grad_norm": 0.0634765625,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1307.445846601,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1115.571375,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1150.240427,
          "forward_backward_time": 157.103401,
          "rollout_overhead_time": 34.669052,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": -0.36766910552978516,
          "grad_norm": 0.0615234375,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14550552144646645,
          "clip_ratio/low_mean": 0.0006198861810844392,
          "clip_ratio/low_min": 0.0006198861810844392,
          "clip_ratio/high_mean": 0.0006267015924095176,
          "clip_ratio/high_max": 0.0006267015924095176,
          "clip_ratio/region_mean": 0.0012465877734939568,
          "step_time": 157.2177628310003,
          "entropy_control/entropy": 0.20025774703837768,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 157.113298,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.15657348930835724,
          "grad_norm": 0.080078125,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 770.8214285714286,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 104114.0,
          "completions/mean_length": 3805.375,
          "completions/min_length": 2013.0,
          "completions/max_length": 7910.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3805.375,
          "completions/min_terminated_length": 2013.0,
          "completions/max_terminated_length": 7910.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6259031295776367,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.18856824934482574,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2314550280570984,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.8029865026473999,
          "reward_std": 0.3228488862514496,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19134098012000322,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1627.6266247210006,
          "entropy_control/entropy": 0.19150208340759745,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1391.188849,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1431.552137,
          "forward_backward_time": 195.959858,
          "rollout_overhead_time": 40.363288,
          "peak_allocated_gib": 53.68960475921631,
          "peak_reserved_gib": 61.484375
        },
        {
          "step": 4,
          "loss": 0.15650466084480286,
          "grad_norm": 0.080078125,
          "learning_rate": 9.4e-06,
          "entropy": 0.19041317608207464,
          "clip_ratio/low_mean": 0.0009439951099921018,
          "clip_ratio/low_min": 0.0009439951099921018,
          "clip_ratio/high_mean": 0.00044810882354795467,
          "clip_ratio/high_max": 0.00044810882354795467,
          "clip_ratio/region_mean": 0.0013921039335400565,
          "step_time": 196.10917739700062,
          "entropy_control/entropy": 0.1905926968047838,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 195.992883,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 53.68960475921631,
          "peak_reserved_gib": 61.484375,
          "reward": null
        },
        {
          "step": 5,
          "loss": -0.20414340496063232,
          "grad_norm": 0.09912109375,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 653.15625,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 148180.0,
          "completions/mean_length": 2803.25,
          "completions/min_length": 1984.0,
          "completions/max_length": 4650.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 2803.25,
          "completions/min_terminated_length": 1984.0,
          "completions/max_terminated_length": 4650.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6677709817886353,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.10812530666589737,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.07715168595314026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8990209102630615,
          "reward_std": 0.10426770895719528,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17905353382229805,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 943.5877459760004,
          "entropy_control/entropy": 0.18634943474164326,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 823.17774,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 845.614013,
          "forward_backward_time": 97.867061,
          "rollout_overhead_time": 22.436273,
          "peak_allocated_gib": 53.68960475921631,
          "peak_reserved_gib": 61.4921875
        },
        {
          "step": 6,
          "loss": -0.20495037734508514,
          "grad_norm": 0.09814453125,
          "learning_rate": 9e-06,
          "entropy": 0.17913627997040749,
          "clip_ratio/low_mean": 0.0017803673981688917,
          "clip_ratio/low_min": 0.0017803673981688917,
          "clip_ratio/high_mean": 0.00029758658638456836,
          "clip_ratio/high_max": 0.00029758658638456836,
          "clip_ratio/region_mean": 0.00207795398455346,
          "step_time": 97.99755129099958,
          "entropy_control/entropy": 0.186299497104382,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 97.886359,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 53.68960475921631,
          "peak_reserved_gib": 61.4921875,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.13794663548469543,
          "grad_norm": 0.054931640625,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 649.7137755102041,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 214624.0,
          "completions/mean_length": 4838.0,
          "completions/min_length": 3071.0,
          "completions/max_length": 5855.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5090.4287109375,
          "completions/min_terminated_length": 4301.0,
          "completions/max_terminated_length": 5855.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.032258063554763794,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7492401599884033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1634497493505478,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.543454647064209,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4938512444496155,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7588474750518799,
          "reward_std": 0.5387411713600159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16913630813360214,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1794.1383231250002,
          "entropy_control/entropy": 0.19205359679628978,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1524.395877,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1571.036354,
          "forward_backward_time": 222.998039,
          "rollout_overhead_time": 46.640476,
          "peak_allocated_gib": 57.67082643508911,
          "peak_reserved_gib": 64.12890625
        },
        {
          "step": 8,
          "loss": -0.13806083798408508,
          "grad_norm": 0.056396484375,
          "learning_rate": 8.6e-06,
          "entropy": 0.16933406330645084,
          "clip_ratio/low_mean": 0.0014047705917619169,
          "clip_ratio/low_min": 0.0014047705917619169,
          "clip_ratio/high_mean": 0.0003195654026058037,
          "clip_ratio/high_max": 0.0003195654026058037,
          "clip_ratio/region_mean": 0.0017243359943677206,
          "step_time": 223.11134523700093,
          "entropy_control/entropy": 0.19230884432662818,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 222.991656,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 57.67082643508911,
          "peak_reserved_gib": 64.12890625,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.038439735770225525,
          "grad_norm": 0.06103515625,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 833.625,
          "thinking/budget_hit_fraction": 0.25,
          "num_tokens": 279413.0,
          "completions/mean_length": 4814.625,
          "completions/min_length": 3024.0,
          "completions/max_length": 7275.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4814.625,
          "completions/min_terminated_length": 3024.0,
          "completions/max_terminated_length": 7275.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6691635251045227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11923417448997498,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6302784085273743,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.021266307681798935,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19245009124279022,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8736792802810669,
          "reward_std": 0.08214110136032104,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20976854860782623,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2104.989630897003,
          "entropy_control/entropy": 0.20675822542460923,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1785.25502,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1839.428141,
          "forward_backward_time": 265.438223,
          "rollout_overhead_time": 54.173121,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 10,
          "loss": -0.0384441539645195,
          "grad_norm": 0.0625,
          "learning_rate": 8.2e-06,
          "entropy": 0.209997046738863,
          "clip_ratio/low_mean": 0.0014056539366720244,
          "clip_ratio/low_min": 0.0014056539366720244,
          "clip_ratio/high_mean": 0.00027252716972725466,
          "clip_ratio/high_max": 0.00027252716972725466,
          "clip_ratio/region_mean": 0.001678181106399279,
          "step_time": 265.4383719210018,
          "entropy_control/entropy": 0.206922773582336,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 265.318509,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 11,
          "loss": -0.1930418461561203,
          "grad_norm": 0.0625,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 538.2755102040817,
          "thinking/budget_hit_fraction": 0.07397959183673468,
          "num_tokens": 334052.0,
          "completions/mean_length": 3520.875,
          "completions/min_length": 1712.0,
          "completions/max_length": 6269.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3520.875,
          "completions/min_terminated_length": 1712.0,
          "completions/max_terminated_length": 6269.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5194672346115112,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.36497068405151367,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5864843726158142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.23310863971710205,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.6727674603462219,
          "reward_std": 0.47311633825302124,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17794616241008043,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1713.9672958210012,
          "entropy_control/entropy": 0.18543802125086845,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1493.682371,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1531.594649,
          "forward_backward_time": 182.250001,
          "rollout_overhead_time": 37.912278,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 12,
          "loss": -0.19339165091514587,
          "grad_norm": 0.06103515625,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.17742812866345048,
          "clip_ratio/low_mean": 0.00016134236648213118,
          "clip_ratio/low_min": 0.00016134236648213118,
          "clip_ratio/high_mean": 0.0008200673182727769,
          "clip_ratio/high_max": 0.0008200673182727769,
          "clip_ratio/region_mean": 0.000981409684754908,
          "step_time": 182.38993302600284,
          "entropy_control/entropy": 0.18502110753660309,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 182.271258,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.3882444202899933,
          "grad_norm": 0.0546875,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 654.7202380952381,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 390022.0,
          "completions/mean_length": 3711.25,
          "completions/min_length": 2549.0,
          "completions/max_length": 5202.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3802.71435546875,
          "completions/min_terminated_length": 2549.0,
          "completions/max_terminated_length": 5202.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6672567129135132,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11540427803993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.48572278022766113,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3274116814136505,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7504480481147766,
          "reward_std": 0.39120444655418396,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1802157610654831,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1381.0262770810004,
          "entropy_control/entropy": 0.20467618746349558,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1174.97906,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1210.476384,
          "forward_backward_time": 170.431939,
          "rollout_overhead_time": 35.497324,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 14,
          "loss": -0.3882194757461548,
          "grad_norm": 0.0546875,
          "learning_rate": 7.4e-06,
          "entropy": 0.18055002391338348,
          "clip_ratio/low_mean": 0.000992554210824892,
          "clip_ratio/low_min": 0.000992554210824892,
          "clip_ratio/high_mean": 0.000505655276356265,
          "clip_ratio/high_max": 0.000505655276356265,
          "clip_ratio/region_mean": 0.0014982094871811569,
          "step_time": 170.54123297400292,
          "entropy_control/entropy": 0.20512804829279208,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 170.422358,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.09555818140506744,
          "grad_norm": 0.054443359375,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 858.0555555555555,
          "thinking/budget_hit_fraction": 0.22916666666666666,
          "num_tokens": 462068.0,
          "completions/mean_length": 5522.25,
          "completions/min_length": 2731.0,
          "completions/max_length": 8343.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5522.25,
          "completions/min_terminated_length": 2731.0,
          "completions/max_terminated_length": 8343.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.03333333507180214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.730453610420227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1056305542588234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8973628878593445,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08619581162929535,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0336999893188477,
          "reward_std": 0.12287236750125885,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17676966823637486,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2225.683277173999,
          "entropy_control/entropy": 0.17954016063507616,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1939.05255,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1988.181629,
          "forward_backward_time": 237.386505,
          "rollout_overhead_time": 49.129078,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 16,
          "loss": -0.09546507149934769,
          "grad_norm": 0.053466796875,
          "learning_rate": 7e-06,
          "entropy": 0.17667382024228573,
          "clip_ratio/low_mean": 0.0014553236178471707,
          "clip_ratio/low_min": 0.0014553236178471707,
          "clip_ratio/high_mean": 0.0003516139186103828,
          "clip_ratio/high_max": 0.0003516139186103828,
          "clip_ratio/region_mean": 0.0018069375364575535,
          "step_time": 237.47537800700047,
          "entropy_control/entropy": 0.1795387570793141,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 237.355971,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.33884182572364807,
          "grad_norm": 0.05419921875,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 480.4959183673469,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 520469.0,
          "completions/mean_length": 3609.125,
          "completions/min_length": 1630.0,
          "completions/max_length": 6829.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3686.000244140625,
          "completions/min_terminated_length": 1630.0,
          "completions/max_terminated_length": 6829.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.03846153989434242,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5374807715415955,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.35832566022872925,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7045713663101196,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1158401221036911,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7887344360351562,
          "reward_std": 0.4061516523361206,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1640746984630823,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1791.069795530997,
          "entropy_control/entropy": 0.1958823486718863,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1497.803051,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1548.337111,
          "forward_backward_time": 242.613345,
          "rollout_overhead_time": 50.53406,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 18,
          "loss": -0.33923161029815674,
          "grad_norm": 0.053466796875,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.16425933130085468,
          "clip_ratio/low_mean": 0.0006798447866458446,
          "clip_ratio/low_min": 0.0006798447866458446,
          "clip_ratio/high_mean": 0.0010638363746693358,
          "clip_ratio/high_max": 0.0010638363746693358,
          "clip_ratio/region_mean": 0.0017436811613151804,
          "step_time": 242.6830074339996,
          "entropy_control/entropy": 0.19605819728218557,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 242.570539,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.012447401881217957,
          "grad_norm": 0.08935546875,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 674.6964285714286,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 575269.0,
          "completions/mean_length": 3959.5,
          "completions/min_length": 2473.0,
          "completions/max_length": 6220.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3959.5,
          "completions/min_terminated_length": 2473.0,
          "completions/max_terminated_length": 6220.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.607343316078186,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.004687517881393433,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8638374209403992,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07588943839073181,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9605903625488281,
          "reward_std": 0.14316250383853912,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19665975868701935,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1663.0609616120018,
          "entropy_control/entropy": 0.1936969557636714,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1392.212287,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1438.877575,
          "forward_backward_time": 224.066708,
          "rollout_overhead_time": 46.665287,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 20,
          "loss": 0.012685425579547882,
          "grad_norm": 0.08349609375,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.19716499000787735,
          "clip_ratio/low_mean": 0.0015608484100084752,
          "clip_ratio/low_min": 0.0015608484100084752,
          "clip_ratio/high_mean": 0.0006244356918614358,
          "clip_ratio/high_max": 0.0006244356918614358,
          "clip_ratio/region_mean": 0.002185284101869911,
          "step_time": 224.124938886991,
          "entropy_control/entropy": 0.19413256457173864,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 224.010219,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.25645989179611206,
          "grad_norm": 0.058837890625,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 739.2238095238096,
          "thinking/budget_hit_fraction": 0.2571428571428571,
          "num_tokens": 636136.0,
          "completions/mean_length": 3909.375,
          "completions/min_length": 2254.0,
          "completions/max_length": 5996.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3909.375,
          "completions/min_terminated_length": 2254.0,
          "completions/max_terminated_length": 5996.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.10526315867900848,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4605706036090851,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3070470690727234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.700609564781189,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1823853850364685,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7566317319869995,
          "reward_std": 0.40518611669540405,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2014899179339409,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1358.554902425003,
          "entropy_control/entropy": 0.20816090601034415,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1133.133636,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1171.653807,
          "forward_backward_time": 186.799026,
          "rollout_overhead_time": 38.520171,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 22,
          "loss": -0.25666821002960205,
          "grad_norm": 0.06591796875,
          "learning_rate": 5.8e-06,
          "entropy": 0.2016368806362152,
          "clip_ratio/low_mean": 0.0011461442772997543,
          "clip_ratio/low_min": 0.0011461442772997543,
          "clip_ratio/high_mean": 0.0003696301246236544,
          "clip_ratio/high_max": 0.0003696301246236544,
          "clip_ratio/region_mean": 0.0015157744019234087,
          "step_time": 186.87984689799487,
          "entropy_control/entropy": 0.20827655213029939,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 186.76527,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.2094455063343048,
          "grad_norm": 0.072265625,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 690.1527777777778,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 692023.0,
          "completions/mean_length": 4100.375,
          "completions/min_length": 2039.0,
          "completions/max_length": 6449.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4100.375,
          "completions/min_terminated_length": 2039.0,
          "completions/max_terminated_length": 6449.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6095624566078186,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8230918645858765,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0027063225861638784,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9423688650131226,
          "reward_std": 0.10680093616247177,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1906361961737275,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1482.741087434002,
          "entropy_control/entropy": 0.19142697965461175,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1277.44327,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1313.633773,
          "forward_backward_time": 168.986496,
          "rollout_overhead_time": 36.190503,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 24,
          "loss": 0.20957893133163452,
          "grad_norm": 0.07275390625,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.19064043555408716,
          "clip_ratio/low_mean": 0.0005921031697653234,
          "clip_ratio/low_min": 0.0005921031697653234,
          "clip_ratio/high_mean": 0.0009996965964091942,
          "clip_ratio/high_max": 0.0009996965964091942,
          "clip_ratio/region_mean": 0.0015917997661745176,
          "step_time": 169.07731957399665,
          "entropy_control/entropy": 0.19152861339121893,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 168.956209,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.14349018037319183,
          "grad_norm": 0.08203125,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 712.575,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 745634.0,
          "completions/mean_length": 3611.375,
          "completions/min_length": 2148.0,
          "completions/max_length": 4889.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3611.375,
          "completions/min_terminated_length": 2148.0,
          "completions/max_terminated_length": 4889.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6715044975280762,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12447243928909302,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6671483516693115,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11642485857009888,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8984931111335754,
          "reward_std": 0.1038915365934372,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19667992927134037,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1322.410297416005,
          "entropy_control/entropy": 0.20309221561600888,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1141.403989,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1173.571129,
          "forward_backward_time": 148.727847,
          "rollout_overhead_time": 32.167139,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 26,
          "loss": -0.14316785335540771,
          "grad_norm": 0.078125,
          "learning_rate": 5e-06,
          "entropy": 0.1969421859830618,
          "clip_ratio/low_mean": 0.0017875201592687517,
          "clip_ratio/low_min": 0.0017875201592687517,
          "clip_ratio/high_mean": 0.0003260288794990629,
          "clip_ratio/high_max": 0.0003260288794990629,
          "clip_ratio/region_mean": 0.0021135490387678146,
          "step_time": 148.8309440800076,
          "entropy_control/entropy": 0.20345788274826315,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 148.727129,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 27,
          "loss": -0.06274816393852234,
          "grad_norm": 0.0693359375,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 572.0399659863946,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 804774.0,
          "completions/mean_length": 4090.0,
          "completions/min_length": 2118.0,
          "completions/max_length": 5898.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4235.57177734375,
          "completions/min_terminated_length": 2118.0,
          "completions/max_terminated_length": 5898.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5661505460739136,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.22813044488430023,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.38490021228790283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5091716647148132,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.45859766006469727,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.60328608751297,
          "reward_std": 0.544246256351471,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14777466095983982,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1568.3047927020052,
          "entropy_control/entropy": 0.16951632124726934,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1265.271209,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1316.730336,
          "forward_backward_time": 251.466472,
          "rollout_overhead_time": 51.459127,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125
        },
        {
          "step": 28,
          "loss": -0.06255805492401123,
          "grad_norm": 0.0673828125,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.14784383215010166,
          "clip_ratio/low_mean": 0.0007143398688640445,
          "clip_ratio/low_min": 0.0007143398688640445,
          "clip_ratio/high_mean": 0.0007623398123541847,
          "clip_ratio/high_max": 0.0007623398123541847,
          "clip_ratio/region_mean": 0.0014766796812182292,
          "step_time": 251.54640228600329,
          "entropy_control/entropy": 0.16952065923173681,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 251.439412,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.6328125,
          "reward": null
        },
        {
          "step": 29,
          "loss": 0.05750003829598427,
          "grad_norm": 0.072265625,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 673.2035714285714,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 869160.0,
          "completions/mean_length": 4765.75,
          "completions/min_length": 1572.0,
          "completions/max_length": 7415.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4765.75,
          "completions/min_terminated_length": 1572.0,
          "completions/max_terminated_length": 7415.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.1071428582072258,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6086075305938721,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5874189138412476,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.25575050711631775,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.771971583366394,
          "reward_std": 0.3044925630092621,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19841952435672283,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1826.776519818999,
          "entropy_control/entropy": 0.20271056372889976,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1508.021128,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1561.827371,
          "forward_backward_time": 264.8428,
          "rollout_overhead_time": 53.806243,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.80859375
        },
        {
          "step": 30,
          "loss": 0.05753684788942337,
          "grad_norm": 0.068359375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.19805839471518993,
          "clip_ratio/low_mean": 0.00011800404899986461,
          "clip_ratio/low_min": 0.00011800404899986461,
          "clip_ratio/high_mean": 0.000237524276599288,
          "clip_ratio/high_max": 0.000237524276599288,
          "clip_ratio/region_mean": 0.0003555283255991526,
          "step_time": 264.89417385499473,
          "entropy_control/entropy": 0.20232579636542353,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 264.791987,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.80859375,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.08018381893634796,
          "grad_norm": 0.08837890625,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 719.7777777777778,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 930599.0,
          "completions/mean_length": 4596.375,
          "completions/min_length": 3064.0,
          "completions/max_length": 6267.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4596.375,
          "completions/min_terminated_length": 3064.0,
          "completions/max_terminated_length": 6267.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7773112058639526,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2507764399051666,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.15430335700511932,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0023112297058105,
          "reward_std": 0.2496374100446701,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19933259673416615,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1455.752558099004,
          "entropy_control/entropy": 0.2018930165597738,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1230.853753,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1270.152366,
          "forward_backward_time": 185.492087,
          "rollout_overhead_time": 39.298613,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.80859375
        },
        {
          "step": 32,
          "loss": 0.08029289543628693,
          "grad_norm": 0.07421875,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.1996234729886055,
          "clip_ratio/low_mean": 0.0007656209054403007,
          "clip_ratio/low_min": 0.0007656209054403007,
          "clip_ratio/high_mean": 0.0005647374273394234,
          "clip_ratio/high_max": 0.0005647374273394234,
          "clip_ratio/region_mean": 0.0013303583327797242,
          "step_time": 185.55397482400076,
          "entropy_control/entropy": 0.2021787957564968,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 185.449541,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.80859375,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.17429736256599426,
          "grad_norm": 0.0537109375,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 635.0119047619047,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 984979.0,
          "completions/mean_length": 3902.0,
          "completions/min_length": 2860.0,
          "completions/max_length": 5233.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4020.71435546875,
          "completions/min_terminated_length": 2860.0,
          "completions/max_terminated_length": 5233.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.05000000074505806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5030142068862915,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.3381158411502838,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8578818440437317,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06588447093963623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8544063568115234,
          "reward_std": 0.43808114528656006,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16345028206706047,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1260.1165995250049,
          "entropy_control/entropy": 0.1901272417645771,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1068.786813,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1102.486461,
          "forward_backward_time": 157.532617,
          "rollout_overhead_time": 33.699647,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.80859375
        },
        {
          "step": 34,
          "loss": -0.17431220412254333,
          "grad_norm": 0.052490234375,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.16317202150821686,
          "clip_ratio/low_mean": 0.0009362715936731547,
          "clip_ratio/low_min": 0.0009362715936731547,
          "clip_ratio/high_mean": 0.0008944949295255356,
          "clip_ratio/high_max": 0.0008944949295255356,
          "clip_ratio/region_mean": 0.0018307665231986903,
          "step_time": 157.62631366799906,
          "entropy_control/entropy": 0.1897910693214771,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 157.523362,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.65529108047485,
          "peak_reserved_gib": 70.80859375,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.1423398107290268,
          "grad_norm": 0.062255859375,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 662.85,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 1051659.0,
          "completions/mean_length": 4472.0,
          "completions/min_length": 2264.0,
          "completions/max_length": 7392.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4472.0,
          "completions/min_terminated_length": 2264.0,
          "completions/max_terminated_length": 7392.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5661094188690186,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.23527806997299194,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4375000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2808363437652588,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.7379844188690186,
          "reward_std": 0.38319867849349976,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21335223503410816,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1710.421675318994,
          "entropy_control/entropy": 0.21247092390897898,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1349.928758,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1410.28788,
          "forward_backward_time": 300.030776,
          "rollout_overhead_time": 60.359122,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 36,
          "loss": -0.14226660132408142,
          "grad_norm": 0.0576171875,
          "learning_rate": 3e-06,
          "entropy": 0.21380090340971947,
          "clip_ratio/low_mean": 0.0013880024635000154,
          "clip_ratio/low_min": 0.0013880024635000154,
          "clip_ratio/high_mean": 0.0004817337612621486,
          "clip_ratio/high_max": 0.0004817337612621486,
          "clip_ratio/region_mean": 0.001869736224762164,
          "step_time": 300.1433946209945,
          "entropy_control/entropy": 0.21280985767545538,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 300.032993,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.06676673144102097,
          "grad_norm": 0.064453125,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 720.0892857142857,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 1116140.0,
          "completions/mean_length": 5180.125,
          "completions/min_length": 2771.0,
          "completions/max_length": 7024.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5180.125,
          "completions/min_terminated_length": 2771.0,
          "completions/max_terminated_length": 7024.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.06060606241226196,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6381549835205078,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.3154814541339874,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.2916666567325592,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5676366090774536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.22932963073253632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "reward": 0.770604133605957,
          "reward_std": 0.3584084212779999,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20501251704990864,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2042.283405759008,
          "entropy_control/entropy": 0.2084450076313529,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 1791.217466,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1834.225008,
          "forward_backward_time": 207.952013,
          "rollout_overhead_time": 43.007542,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 38,
          "loss": 0.06687550246715546,
          "grad_norm": 0.064453125,
          "learning_rate": 2.6e-06,
          "entropy": 0.2049033436924219,
          "clip_ratio/low_mean": 0.0004826112708542496,
          "clip_ratio/low_min": 0.0004826112708542496,
          "clip_ratio/high_mean": 0.0006639463208557572,
          "clip_ratio/high_max": 0.0006639463208557572,
          "clip_ratio/region_mean": 0.0011465575917100068,
          "step_time": 208.07504388699454,
          "entropy_control/entropy": 0.20831680852214052,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 207.96491,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.1414264291524887,
          "grad_norm": 0.0732421875,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 614.2261904761905,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1173866.0,
          "completions/mean_length": 4124.75,
          "completions/min_length": 2546.0,
          "completions/max_length": 6556.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4124.75,
          "completions/min_terminated_length": 2546.0,
          "completions/max_terminated_length": 6556.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7013591527938843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.24371957778930664,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2136233150959015,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.924275815486908,
          "reward_std": 0.238555446267128,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19241669587790966,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1623.65240167499,
          "entropy_control/entropy": 0.19407293279736726,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1320.964607,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1371.632097,
          "forward_backward_time": 251.920862,
          "rollout_overhead_time": 50.66749,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 40,
          "loss": -0.14135050773620605,
          "grad_norm": 0.07421875,
          "learning_rate": 2.2e-06,
          "entropy": 0.19248690083622932,
          "clip_ratio/low_mean": 0.0005736229577451013,
          "clip_ratio/low_min": 0.0005736229577451013,
          "clip_ratio/high_mean": 0.0008601539011579007,
          "clip_ratio/high_max": 0.0008601539011579007,
          "clip_ratio/region_mean": 0.001433776858903002,
          "step_time": 252.00426232099562,
          "entropy_control/entropy": 0.194069118367981,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 251.903949,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.4750300943851471,
          "grad_norm": 0.037841796875,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 909.4222222222221,
          "thinking/budget_hit_fraction": 0.22777777777777777,
          "num_tokens": 1243351.0,
          "completions/mean_length": 5208.625,
          "completions/min_length": 3071.0,
          "completions/max_length": 8981.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 5921.1669921875,
          "completions/min_terminated_length": 4462.0,
          "completions/max_terminated_length": 8981.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6518133282661438,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.4416067898273468,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4880439043045044,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.32949313521385193,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.6834702491760254,
          "reward_std": 0.5577273964881897,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17076805979013443,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2157.995117664992,
          "entropy_control/entropy": 0.2206734436527375,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1819.711307,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1876.314375,
          "forward_backward_time": 281.556777,
          "rollout_overhead_time": 56.603067,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 42,
          "loss": -0.4752137362957001,
          "grad_norm": 0.031494140625,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.17083237878978252,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0007528942805947736,
          "clip_ratio/high_max": 0.0007528942805947736,
          "clip_ratio/region_mean": 0.0007528942805947736,
          "step_time": 281.58093438699143,
          "entropy_control/entropy": 0.22086477739931318,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 281.458833,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 43,
          "loss": 0.03924206644296646,
          "grad_norm": 0.0810546875,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 493.9948979591837,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 1296289.0,
          "completions/mean_length": 3313.25,
          "completions/min_length": 2179.0,
          "completions/max_length": 5413.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3313.25,
          "completions/min_terminated_length": 2179.0,
          "completions/max_terminated_length": 5413.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5816929340362549,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.24924789369106293,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5737302899360657,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.22210049629211426,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.6985449194908142,
          "reward_std": 0.40811148285865784,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19458864256739616,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1488.8086183090054,
          "entropy_control/entropy": 0.19670942085366805,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1263.270646,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1301.816107,
          "forward_backward_time": 186.859284,
          "rollout_overhead_time": 38.545462,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 44,
          "loss": 0.039154961705207825,
          "grad_norm": 0.078125,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.1948654819279909,
          "clip_ratio/low_mean": 0.0006667591078439727,
          "clip_ratio/low_min": 0.0006667591078439727,
          "clip_ratio/high_mean": 0.0008239384260377847,
          "clip_ratio/high_max": 0.0008239384260377847,
          "clip_ratio/region_mean": 0.0014906975338817574,
          "step_time": 186.98488715499843,
          "entropy_control/entropy": 0.19700822117510752,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 186.85173,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.12898582220077515,
          "grad_norm": 0.0693359375,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 689.8571428571429,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 1366177.0,
          "completions/mean_length": 5066.0,
          "completions/min_length": 1853.0,
          "completions/max_length": 7091.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5066.0,
          "completions/min_terminated_length": 1853.0,
          "completions/max_terminated_length": 7091.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.561121940612793,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.21304446458816528,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6660890579223633,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11354804039001465,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7833971381187439,
          "reward_std": 0.30454862117767334,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20160364359617233,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2151.2422908390145,
          "entropy_control/entropy": 0.20532171599279905,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1822.015512,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1876.851635,
          "forward_backward_time": 274.269095,
          "rollout_overhead_time": 54.836124,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 46,
          "loss": -0.12891356647014618,
          "grad_norm": 0.08544921875,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.20192984119057655,
          "clip_ratio/low_mean": 0.0010274413361912593,
          "clip_ratio/low_min": 0.0010274413361912593,
          "clip_ratio/high_mean": 0.00024982879040180705,
          "clip_ratio/high_max": 0.00024982879040180705,
          "clip_ratio/region_mean": 0.0012772701265930664,
          "step_time": 274.3883095810015,
          "entropy_control/entropy": 0.20559768318617128,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 274.276248,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.09007535874843597,
          "grad_norm": 0.07763671875,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 856.5649999999999,
          "thinking/budget_hit_fraction": 0.275,
          "num_tokens": 1430710.0,
          "completions/mean_length": 4780.125,
          "completions/min_length": 1957.0,
          "completions/max_length": 7289.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4780.125,
          "completions/min_terminated_length": 1957.0,
          "completions/max_terminated_length": 7289.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6431146860122681,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0671430230140686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7154762744903564,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3168836534023285,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.851170539855957,
          "reward_std": 0.34725460410118103,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19823584705591202,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1800.7287981380068,
          "entropy_control/entropy": 0.20250650673586154,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1560.024169,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1601.645599,
          "forward_backward_time": 198.97692,
          "rollout_overhead_time": 41.62143,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 48,
          "loss": -0.08989251405000687,
          "grad_norm": 0.06787109375,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.19837375171482563,
          "clip_ratio/low_mean": 0.001343853582511656,
          "clip_ratio/low_min": 0.001343853582511656,
          "clip_ratio/high_mean": 0.0006475899936049245,
          "clip_ratio/high_max": 0.0006475899936049245,
          "clip_ratio/region_mean": 0.0019914435761165805,
          "step_time": 199.12135581698385,
          "entropy_control/entropy": 0.2027051213315856,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 198.999611,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.04273369163274765,
          "grad_norm": 0.072265625,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 715.2916666666666,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 1493808.0,
          "completions/mean_length": 4596.25,
          "completions/min_length": 2868.0,
          "completions/max_length": 6596.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4596.25,
          "completions/min_terminated_length": 2868.0,
          "completions/max_terminated_length": 6596.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.07407407462596893,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7445147633552551,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.09768664091825485,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7022172212600708,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.35914701223373413,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9473243355751038,
          "reward_std": 0.24201710522174835,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20186464861035347,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1814.5493688019924,
          "entropy_control/entropy": 0.20290295311124665,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 1556.482902,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1600.315104,
          "forward_backward_time": 214.110287,
          "rollout_overhead_time": 43.832202,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125
        },
        {
          "step": 50,
          "loss": 0.04274625703692436,
          "grad_norm": 0.0693359375,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.20205847918987274,
          "clip_ratio/low_mean": 0.000517784254043363,
          "clip_ratio/low_min": 0.000517784254043363,
          "clip_ratio/high_mean": 0.0008554057894798461,
          "clip_ratio/high_max": 0.0008554057894798461,
          "clip_ratio/region_mean": 0.0013731900435232092,
          "step_time": 214.24098803201196,
          "entropy_control/entropy": 0.20315267632682507,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 214.113101,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.30920124053955,
          "peak_reserved_gib": 76.08203125,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4058,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.9675266661987673,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 8233,
          "reward_channels": {
            "native": 0.9675266661987673,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3996,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8404385754973732,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5137,
          "reward_channels": {
            "native": 0.8404385754973732,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3603,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4155,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3214,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5817,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2626,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2805,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4228,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2997,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2936,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8062415512788537,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 5012,
          "reward_channels": {
            "native": 0.8062415512788537,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.7060268919310104,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2620,
          "reward_channels": {
            "native": 0.7060268919310104,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.811786874720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4790,
          "reward_channels": {
            "native": 0.811786874720879,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 6332,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3325,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.9879763779626005,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6128,
          "reward_channels": {
            "native": 0.9879763779626005,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.578198213067076,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 7521,
          "reward_channels": {
            "native": 0.578198213067076,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 7015,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4539,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6512057439829095,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4658,
          "reward_channels": {
            "native": 0.6512057439829095,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6099965928016736,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6365,
          "reward_channels": {
            "native": 0.6099965928016736,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.7927032521897649,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 3955,
          "reward_channels": {
            "native": 0.7927032521897649,
            "efficiency": 0.0,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3825,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.7503548418171574,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5119,
          "reward_channels": {
            "native": 0.7503548418171574,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.7005591947284964,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4116,
          "reward_channels": {
            "native": 0.7005591947284964,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3746,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2042,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 4521,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4345,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3160,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5310,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 7909,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3915,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3958,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5047,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2468,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4523,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789312185",
      "mode": "thinking",
      "method": "cispo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8387576556205749,
      "train_last10": 0.8950886785984039,
      "holdout_native": 0.606788222286585,
      "holdout_episodes": 40,
      "holdout_successes": 33,
      "mean_step_seconds": 907.3916725414009,
      "label": "CISPO",
      "state_at_cutoff": "complete",
      "step_hours": 12.602662118630569,
      "peak_allocated_gib": 70.00158309936523,
      "peak_reserved_gib": 77.822265625,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.606788222286585,
        "efficiency": 0.46666666666666673,
        "reliability": 0.7
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "cispo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "cispo",
        "normalization": "joint",
        "entropy_control": {
          "method": "monitor",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "5194bee8a98c562cbef72b829d9d573e4442fe9697418446b63b2cd43cc2b9a9",
        "entropy_holdout_episodes.jsonl": "091926046554bb56cd696d89472414dfa8fbae3281b14b732027b945aca9d900",
        "resolved_training_config.json": "025bb90f7e7c1dd0afc8438d21ddb6dfd229d8bef4df7fd62f09d66d92f579e4"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.05959773063659668,
          "grad_norm": 0.061279296875,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "cispo_clip_ratio": 0.0,
          "step_time": 1432.8779994019997,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1241.577735,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1276.206926,
          "forward_backward_time": 156.563045,
          "rollout_overhead_time": 34.629191,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": 0.059736188501119614,
          "grad_norm": 0.061767578125,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14504320733249187,
          "cispo_clip_ratio": 0.0025359369174111634,
          "step_time": 156.6762321429992,
          "entropy_control/entropy": 0.19971678657231526,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.555146,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.07673680037260056,
          "grad_norm": 0.0673828125,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 675.96,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 103240.0,
          "completions/mean_length": 3696.125,
          "completions/min_length": 1260.0,
          "completions/max_length": 5569.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3696.125,
          "completions/min_terminated_length": 1260.0,
          "completions/max_terminated_length": 5569.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7281777262687683,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12758977711200714,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15430335700511932,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.9531776905059814,
          "reward_std": 0.120913565158844,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19031991995871067,
          "cispo_clip_ratio": 0.0,
          "step_time": 1272.7960069709998,
          "entropy_control/entropy": 0.20376649588502274,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1097.50989,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1128.21115,
          "forward_backward_time": 144.460731,
          "rollout_overhead_time": 30.70126,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375
        },
        {
          "step": 4,
          "loss": 0.07664913684129715,
          "grad_norm": 0.06689453125,
          "learning_rate": 9.4e-06,
          "entropy": 0.19033740274608135,
          "cispo_clip_ratio": 0.0025286943127866834,
          "step_time": 144.7639433240006,
          "entropy_control/entropy": 0.20369696012972682,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 144.645296,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 673.34375,
          "thinking/budget_hit_fraction": 0.21875,
          "num_tokens": 148302.0,
          "completions/mean_length": 2927.75,
          "completions/min_length": 1462.0,
          "completions/max_length": 4656.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 2927.75,
          "completions/min_terminated_length": 1462.0,
          "completions/max_terminated_length": 4656.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.1111111119389534,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6093767881393433,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 4.6674944314872846e-05,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8427101373672485,
          "reward_std": 4.6674944314872846e-05,
          "frac_reward_zero_std": 1.0,
          "frac_groups_zero_std": 1.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18442012928426266,
          "cispo_clip_ratio": 0.0,
          "step_time": 984.4018064339998,
          "entropy_control/entropy": 0.19255304304690926,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 882.771041,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 901.64074,
          "forward_backward_time": 82.650254,
          "rollout_overhead_time": 18.869699,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375
        },
        {
          "step": 6,
          "loss": 0.0,
          "grad_norm": 0.0,
          "learning_rate": 9e-06,
          "entropy": 0.18489300087094307,
          "cispo_clip_ratio": 0.0,
          "step_time": 82.75198730199918,
          "entropy_control/entropy": 0.19300358485280206,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 82.640343,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.051492560654878616,
          "grad_norm": 0.044677734375,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 661.6743197278912,
          "thinking/budget_hit_fraction": 0.16581632653061223,
          "num_tokens": 214410.0,
          "completions/mean_length": 4796.0,
          "completions/min_length": 3071.0,
          "completions/max_length": 7083.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5042.4287109375,
          "completions/min_terminated_length": 3251.0,
          "completions/max_terminated_length": 7083.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5317510962486267,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.35458892583847046,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8048485517501831,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.04181578755378723,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8339248299598694,
          "reward_std": 0.4224560856819153,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16800322569906712,
          "cispo_clip_ratio": 0.0,
          "step_time": 2108.4935946019996,
          "entropy_control/entropy": 0.19551524949746044,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1749.503862,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1809.978419,
          "forward_backward_time": 298.392886,
          "rollout_overhead_time": 60.474557,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 8,
          "loss": 0.05173943191766739,
          "grad_norm": 0.047119140625,
          "learning_rate": 8.6e-06,
          "entropy": 0.1678721159696579,
          "cispo_clip_ratio": 0.00378150338656269,
          "step_time": 298.3895189370005,
          "entropy_control/entropy": 0.19539698056410154,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 298.282565,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.023579686880111694,
          "grad_norm": 0.052978515625,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 933.9440476190475,
          "thinking/budget_hit_fraction": 0.26071428571428573,
          "num_tokens": 277293.0,
          "completions/mean_length": 4576.375,
          "completions/min_length": 2726.0,
          "completions/max_length": 7056.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4791.4287109375,
          "completions/min_terminated_length": 2726.0,
          "completions/max_terminated_length": 7056.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.05000000074505806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6683154702186584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11753809452056885,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.41591623425483704,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.40022072196006775,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7160741686820984,
          "reward_std": 0.4268726706504822,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1945186909288168,
          "cispo_clip_ratio": 0.0,
          "step_time": 1883.930043686999,
          "entropy_control/entropy": 0.22380286454406373,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1629.017555,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1673.223345,
          "forward_backward_time": 210.581205,
          "rollout_overhead_time": 44.20579,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 10,
          "loss": 0.023223545402288437,
          "grad_norm": 0.052001953125,
          "learning_rate": 8.2e-06,
          "entropy": 0.19437705539166927,
          "cispo_clip_ratio": 0.0015916558913886547,
          "step_time": 210.70282552500066,
          "entropy_control/entropy": 0.2235291455100569,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 210.58093,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.06816785037517548,
          "grad_norm": 0.057373046875,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 563.6964285714286,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 333240.0,
          "completions/mean_length": 3684.375,
          "completions/min_length": 1718.0,
          "completions/max_length": 7003.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3772.000244140625,
          "completions/min_terminated_length": 1718.0,
          "completions/max_terminated_length": 7003.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5645434856414795,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.3898860514163971,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.31549492478370667,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6680818796157837,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11817905306816101,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7871460914611816,
          "reward_std": 0.4111788272857666,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17892753519117832,
          "cispo_clip_ratio": 0.0,
          "step_time": 1801.6967272129987,
          "entropy_control/entropy": 0.20602153379997154,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1499.890518,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1550.885347,
          "forward_backward_time": 250.697833,
          "rollout_overhead_time": 50.994829,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 12,
          "loss": 0.06817689538002014,
          "grad_norm": 0.057373046875,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.1793829184025526,
          "cispo_clip_ratio": 0.0026480586966499686,
          "step_time": 250.81987606999792,
          "entropy_control/entropy": 0.20650926472102377,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 250.708816,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 13,
          "loss": 0.05013948678970337,
          "grad_norm": 0.046142578125,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 884.5952380952382,
          "thinking/budget_hit_fraction": 0.2857142857142857,
          "num_tokens": 395227.0,
          "completions/mean_length": 4463.375,
          "completions/min_length": 2704.0,
          "completions/max_length": 6607.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4662.2861328125,
          "completions/min_terminated_length": 2704.0,
          "completions/max_terminated_length": 6607.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6323727369308472,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.04563635587692261,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4600570797920227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.30670472979545593,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7201732397079468,
          "reward_std": 0.37280964851379395,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17529656179249287,
          "cispo_clip_ratio": 0.0,
          "step_time": 1510.479915453001,
          "entropy_control/entropy": 0.2079731292202752,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1285.932623,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1325.368707,
          "forward_backward_time": 185.008122,
          "rollout_overhead_time": 39.436085,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 14,
          "loss": 0.04992172494530678,
          "grad_norm": 0.045654296875,
          "learning_rate": 7.4e-06,
          "entropy": 0.1745990291237831,
          "cispo_clip_ratio": 0.001840055309003219,
          "step_time": 185.10257531900243,
          "entropy_control/entropy": 0.2071626262243796,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 184.996985,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.00855071097612381,
          "grad_norm": 0.059814453125,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 816.6666666666666,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 460157.0,
          "completions/mean_length": 4632.75,
          "completions/min_length": 3274.0,
          "completions/max_length": 7270.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4632.75,
          "completions/min_terminated_length": 3274.0,
          "completions/max_terminated_length": 7270.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6072787046432495,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.013663023710250854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8640799522399902,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08177304267883301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.962762713432312,
          "reward_std": 0.1477309763431549,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21425736043602228,
          "cispo_clip_ratio": 0.0,
          "step_time": 1604.1281318940019,
          "entropy_control/entropy": 0.22083469835945016,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1360.390406,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1402.625146,
          "forward_backward_time": 201.401124,
          "rollout_overhead_time": 42.23474,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 16,
          "loss": -0.008626427501440048,
          "grad_norm": 0.053955078125,
          "learning_rate": 7e-06,
          "entropy": 0.2144729858264327,
          "cispo_clip_ratio": 0.0010139655496459454,
          "step_time": 201.4823421400033,
          "entropy_control/entropy": 0.22101901031865806,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 201.376088,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.022877300158143044,
          "grad_norm": 0.057373046875,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 753.3971088435374,
          "thinking/budget_hit_fraction": 0.21428571428571427,
          "num_tokens": 532896.0,
          "completions/mean_length": 5401.375,
          "completions/min_length": 2972.0,
          "completions/max_length": 8553.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5401.375,
          "completions/min_terminated_length": 2972.0,
          "completions/max_terminated_length": 8553.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.032258063554763794,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4319382905960083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2100842446088791,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7295446395874023,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.09698600322008133,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.20971761643886566,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.6994915008544922,
          "reward_std": 0.40824830532073975,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18524269945919514,
          "cispo_clip_ratio": 0.0,
          "step_time": 2233.6526770439923,
          "entropy_control/entropy": 0.1851913962170918,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1883.715355,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1942.822108,
          "forward_backward_time": 290.71654,
          "rollout_overhead_time": 59.106752,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 18,
          "loss": -0.022642826661467552,
          "grad_norm": 0.052978515625,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.18491178378462791,
          "cispo_clip_ratio": 0.002408703847322613,
          "step_time": 290.79190560100324,
          "entropy_control/entropy": 0.18482873933896737,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 290.683148,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 19,
          "loss": -0.027121691033244133,
          "grad_norm": 0.0556640625,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 573.375,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 587462.0,
          "completions/mean_length": 3930.25,
          "completions/min_length": 1782.0,
          "completions/max_length": 6024.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3930.25,
          "completions/min_terminated_length": 1782.0,
          "completions/max_terminated_length": 6024.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.08695652335882187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6096870303153992,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7011142373085022,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.35796624422073364,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8835256695747375,
          "reward_std": 0.2356216162443161,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1949994508177042,
          "cispo_clip_ratio": 0.0,
          "step_time": 1453.557944958,
          "entropy_control/entropy": 0.2024309433565279,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1206.809612,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1249.328148,
          "forward_backward_time": 204.126315,
          "rollout_overhead_time": 42.518535,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 20,
          "loss": -0.027196794748306274,
          "grad_norm": 0.048583984375,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.19486972130835056,
          "cispo_clip_ratio": 0.0017310466500930488,
          "step_time": 204.21084985199923,
          "entropy_control/entropy": 0.20227207682142498,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 204.108367,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.0015484169125556946,
          "grad_norm": 0.0712890625,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 555.3928571428571,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 650873.0,
          "completions/mean_length": 4227.375,
          "completions/min_length": 1598.0,
          "completions/max_length": 5516.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4227.375,
          "completions/min_terminated_length": 1598.0,
          "completions/max_terminated_length": 5516.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.07407407462596893,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6140941381454468,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5919007062911987,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2379184514284134,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.7769557237625122,
          "reward_std": 0.2997303307056427,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19899269193410873,
          "cispo_clip_ratio": 0.0,
          "step_time": 1420.192871165993,
          "entropy_control/entropy": 0.20385769032553278,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1173.81351,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1215.831439,
          "forward_backward_time": 204.259396,
          "rollout_overhead_time": 42.017929,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 22,
          "loss": -0.0017351359128952026,
          "grad_norm": 0.06689453125,
          "learning_rate": 5.8e-06,
          "entropy": 0.19878941774368286,
          "cispo_clip_ratio": 0.003685811476316303,
          "step_time": 204.32607309300874,
          "entropy_control/entropy": 0.203702783959607,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 204.224661,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.027916889637708664,
          "grad_norm": 0.07373046875,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 585.8214285714286,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 705962.0,
          "completions/mean_length": 4000.625,
          "completions/min_length": 1995.0,
          "completions/max_length": 7082.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4000.625,
          "completions/min_terminated_length": 1995.0,
          "completions/max_terminated_length": 7082.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7249159812927246,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13324211537837982,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.857026994228363,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06957332044839859,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0138881206512451,
          "reward_std": 0.11696893721818924,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17570242285728455,
          "cispo_clip_ratio": 0.0,
          "step_time": 1558.686015184001,
          "entropy_control/entropy": 0.1775421606632509,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1281.633612,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1328.705847,
          "forward_backward_time": 229.87527,
          "rollout_overhead_time": 47.072235,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 24,
          "loss": 0.0279421154409647,
          "grad_norm": 0.07763671875,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.1764808613806963,
          "cispo_clip_ratio": 0.001917229441460222,
          "step_time": 229.9780768470082,
          "entropy_control/entropy": 0.1782901138241022,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 229.876599,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 25,
          "loss": 0.020461905747652054,
          "grad_norm": 0.058349609375,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 499.8494897959184,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 755267.0,
          "completions/mean_length": 3073.125,
          "completions/min_length": 1262.0,
          "completions/max_length": 7150.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3073.125,
          "completions/min_terminated_length": 1262.0,
          "completions/max_terminated_length": 7150.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.08695652335882187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.609268307685852,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.25848397612571716,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2560417056083679,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.154700517654419,
          "reward": 0.5557511448860168,
          "reward_std": 0.4255915880203247,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17823073640465736,
          "cispo_clip_ratio": 0.0,
          "step_time": 1374.3095642089938,
          "entropy_control/entropy": 0.19470474385825953,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1127.34155,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1170.193834,
          "forward_backward_time": 204.009631,
          "rollout_overhead_time": 42.852285,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 26,
          "loss": 0.02035672590136528,
          "grad_norm": 0.05615234375,
          "learning_rate": 5e-06,
          "entropy": 0.17873864714056253,
          "cispo_clip_ratio": 0.0013546488480642438,
          "step_time": 204.0851919899942,
          "entropy_control/entropy": 0.19520758576970662,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 203.98208,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 27,
          "loss": -0.014896320179104805,
          "grad_norm": 0.061279296875,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 691.5535714285714,
          "thinking/budget_hit_fraction": 0.16964285714285712,
          "num_tokens": 813017.0,
          "completions/mean_length": 3916.25,
          "completions/min_length": 2443.0,
          "completions/max_length": 7757.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3916.25,
          "completions/min_terminated_length": 2443.0,
          "completions/max_terminated_length": 7757.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0476190485060215,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.4889552593231201,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.3313716948032379,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.696678638458252,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.35369956493377686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.7657335996627808,
          "reward_std": 0.4571972191333771,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21122080087661743,
          "cispo_clip_ratio": 0.0,
          "step_time": 1509.8962310990028,
          "entropy_control/entropy": 0.205215673983445,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1269.259398,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1310.572853,
          "forward_backward_time": 199.217093,
          "rollout_overhead_time": 41.313454,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 28,
          "loss": -0.014891263097524643,
          "grad_norm": 0.0673828125,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.21169204264879227,
          "cispo_clip_ratio": 0.003810049034655094,
          "step_time": 199.2965387799959,
          "entropy_control/entropy": 0.20553460569612514,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 199.192826,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.004603184759616852,
          "grad_norm": 0.08349609375,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 661.1130952380953,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 874891.0,
          "completions/mean_length": 4451.75,
          "completions/min_length": 2944.0,
          "completions/max_length": 6588.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4451.75,
          "completions/min_terminated_length": 2944.0,
          "completions/max_terminated_length": 6588.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.03703703731298447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6719769239425659,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12673872709274292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.579635739326477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2551511824131012,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7987229824066162,
          "reward_std": 0.32421475648880005,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20279635302722454,
          "cispo_clip_ratio": 0.0,
          "step_time": 2059.5521601690016,
          "entropy_control/entropy": 0.20050150044775508,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1768.197283,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1817.310238,
          "forward_backward_time": 242.137128,
          "rollout_overhead_time": 49.112956,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 30,
          "loss": -0.004749072249978781,
          "grad_norm": 0.0673828125,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.20302190445363522,
          "cispo_clip_ratio": 0.0029782248311676085,
          "step_time": 242.2114704769956,
          "entropy_control/entropy": 0.20068203646619256,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 242.104717,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 31,
          "loss": -0.013075809925794601,
          "grad_norm": 0.051513671875,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 557.8333333333334,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 928197.0,
          "completions/mean_length": 3579.75,
          "completions/min_length": 2682.0,
          "completions/max_length": 4490.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3579.75,
          "completions/min_terminated_length": 2682.0,
          "completions/max_terminated_length": 4490.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8651880025863647,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07400666177272797,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19795581698417664,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0933129787445068,
          "reward_std": 0.06444501876831055,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2001099605113268,
          "cispo_clip_ratio": 0.0,
          "step_time": 1127.0236637460002,
          "entropy_control/entropy": 0.19981127089133777,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 919.242119,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 955.346876,
          "forward_backward_time": 171.570368,
          "rollout_overhead_time": 36.104757,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 32,
          "loss": -0.013320034369826317,
          "grad_norm": 0.048583984375,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.1999568399041891,
          "cispo_clip_ratio": 0.0010547005804255605,
          "step_time": 171.6825249080066,
          "entropy_control/entropy": 0.19959165633013187,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 171.574778,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.07050250470638275,
          "grad_norm": 0.05712890625,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 520.4097222222223,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 978403.0,
          "completions/mean_length": 3380.25,
          "completions/min_length": 2344.0,
          "completions/max_length": 6682.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3380.25,
          "completions/min_terminated_length": 2344.0,
          "completions/max_terminated_length": 6682.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.1304347813129425,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6095701456069946,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7019290924072266,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3590852916240692,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8849163055419922,
          "reward_std": 0.237877756357193,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19189164973795414,
          "cispo_clip_ratio": 0.0,
          "step_time": 1447.7261638749987,
          "entropy_control/entropy": 0.20349327952755297,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1258.473654,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1292.24578,
          "forward_backward_time": 155.374454,
          "rollout_overhead_time": 33.772126,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125
        },
        {
          "step": 34,
          "loss": -0.07099034637212753,
          "grad_norm": 0.056884765625,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.1921864915639162,
          "cispo_clip_ratio": 0.0021364886197261512,
          "step_time": 155.45952711000064,
          "entropy_control/entropy": 0.20378273496889898,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 155.353332,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.21795797348022,
          "peak_reserved_gib": 75.5078125,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.003738459199666977,
          "grad_norm": 0.05810546875,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 696.1147959183673,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1050726.0,
          "completions/mean_length": 5177.375,
          "completions/min_length": 3816.0,
          "completions/max_length": 7994.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5177.375,
          "completions/min_terminated_length": 3816.0,
          "completions/max_terminated_length": 7994.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7032192945480347,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.20619390904903412,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3541666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.24295634031295776,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.8709275722503662,
          "reward_std": 0.34340617060661316,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2363110724836588,
          "cispo_clip_ratio": 0.0,
          "step_time": 2078.5321845780054,
          "entropy_control/entropy": 0.23738854010738542,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1703.779782,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1766.373098,
          "forward_backward_time": 312.054464,
          "rollout_overhead_time": 62.593315,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 36,
          "loss": 0.002995230257511139,
          "grad_norm": 0.0595703125,
          "learning_rate": 3e-06,
          "entropy": 0.23690798692405224,
          "cispo_clip_ratio": 0.0029003190575167537,
          "step_time": 312.09610687001987,
          "entropy_control/entropy": 0.23801668714223417,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 311.992477,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.038784705102443695,
          "grad_norm": 0.083984375,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 623.4791666666666,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1105921.0,
          "completions/mean_length": 4019.375,
          "completions/min_length": 1065.0,
          "completions/max_length": 6134.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4019.375,
          "completions/min_terminated_length": 1065.0,
          "completions/max_terminated_length": 6134.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.03703703731298447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7263758182525635,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1347351223230362,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7034698128700256,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.1064884141087532,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.9378395080566406,
          "reward_std": 0.10221715271472931,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18527615256607533,
          "cispo_clip_ratio": 0.0,
          "step_time": 1434.1412884339952,
          "entropy_control/entropy": 0.19221650355896527,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 1225.456016,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1261.67663,
          "forward_backward_time": 172.355831,
          "rollout_overhead_time": 36.220614,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 38,
          "loss": 0.03889436274766922,
          "grad_norm": 0.06787109375,
          "learning_rate": 2.6e-06,
          "entropy": 0.18586737290024757,
          "cispo_clip_ratio": 0.00231436311150901,
          "step_time": 172.46150075998594,
          "entropy_control/entropy": 0.19268527457717816,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 172.353799,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.03874988853931427,
          "grad_norm": 0.058837890625,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 595.4499999999999,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1165864.0,
          "completions/mean_length": 4401.875,
          "completions/min_length": 2761.0,
          "completions/max_length": 6486.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4401.875,
          "completions/min_terminated_length": 2761.0,
          "completions/max_terminated_length": 6486.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7549160122871399,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.1321459859609604,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2781743109226227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.9736660718917847,
          "reward_std": 0.11896516382694244,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18749587051570415,
          "cispo_clip_ratio": 0.0,
          "step_time": 1806.3814684290046,
          "entropy_control/entropy": 0.18776935633964761,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1564.981242,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1606.591353,
          "forward_backward_time": 199.681867,
          "rollout_overhead_time": 41.610111,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 40,
          "loss": 0.03878646716475487,
          "grad_norm": 0.0595703125,
          "learning_rate": 2.2e-06,
          "entropy": 0.187082689255476,
          "cispo_clip_ratio": 0.0027922270237468183,
          "step_time": 199.77284794001025,
          "entropy_control/entropy": 0.1873935803470218,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 199.669119,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.02279401570558548,
          "grad_norm": 0.0556640625,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 700.3630952380953,
          "thinking/budget_hit_fraction": 0.19642857142857142,
          "num_tokens": 1235159.0,
          "completions/mean_length": 5184.875,
          "completions/min_length": 2162.0,
          "completions/max_length": 7152.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5184.875,
          "completions/min_terminated_length": 2162.0,
          "completions/max_terminated_length": 7152.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7096945643424988,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.11446171998977661,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5528876781463623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2096613198518753,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.8000410795211792,
          "reward_std": 0.31318575143814087,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20578624680638313,
          "cispo_clip_ratio": 0.0,
          "step_time": 1882.2396674270058,
          "entropy_control/entropy": 0.21090759849034313,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1593.493517,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1642.967185,
          "forward_backward_time": 239.166147,
          "rollout_overhead_time": 49.473668,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 42,
          "loss": 0.023024503141641617,
          "grad_norm": 0.052001953125,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.20608649775385857,
          "cispo_clip_ratio": 0.002797896770061925,
          "step_time": 239.25387795001006,
          "entropy_control/entropy": 0.21126767682563613,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 239.152955,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 43,
          "loss": 0.03825816512107849,
          "grad_norm": 0.07861328125,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 572.6785714285714,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 1292693.0,
          "completions/mean_length": 3887.75,
          "completions/min_length": 2811.0,
          "completions/max_length": 5795.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3887.75,
          "completions/min_terminated_length": 2811.0,
          "completions/max_terminated_length": 5795.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.03846153989434242,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6662607192993164,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.08975932747125626,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6714017987251282,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07128286361694336,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8927896022796631,
          "reward_std": 0.06319531798362732,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18599931336939335,
          "cispo_clip_ratio": 0.0,
          "step_time": 1635.5146522129944,
          "entropy_control/entropy": 0.18642948896211642,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1353.151486,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1400.387877,
          "forward_backward_time": 235.021513,
          "rollout_overhead_time": 47.236391,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 44,
          "loss": 0.038326285779476166,
          "grad_norm": 0.07373046875,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.18594970554113388,
          "cispo_clip_ratio": 0.0018617352470755577,
          "step_time": 235.15527386898611,
          "entropy_control/entropy": 0.18642186386322818,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 235.049395,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 45,
          "loss": 0.04289444908499718,
          "grad_norm": 0.0703125,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 651.801530612245,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 1363121.0,
          "completions/mean_length": 5133.5,
          "completions/min_length": 2004.0,
          "completions/max_length": 8072.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5133.5,
          "completions/min_terminated_length": 2004.0,
          "completions/max_terminated_length": 8072.0,
          "tools/call_frequency": 4.375,
          "tools/failure_frequency": 0.05714285746216774,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7988388538360596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.15891478955745697,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666567325592,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7323082685470581,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.09677081555128098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9811986088752747,
          "reward_std": 0.12073472887277603,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18510518595576286,
          "cispo_clip_ratio": 0.0,
          "step_time": 2391.487052959994,
          "entropy_control/entropy": 0.18973849059490716,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 2060.356795,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2116.187572,
          "forward_backward_time": 275.197723,
          "rollout_overhead_time": 55.830777,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 46,
          "loss": 0.04262041300535202,
          "grad_norm": 0.059814453125,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.18503615446388721,
          "cispo_clip_ratio": 0.0022268831671681255,
          "step_time": 275.21273764799844,
          "entropy_control/entropy": 0.18960556835069395,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 275.111284,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 47,
          "loss": 0.06568296998739243,
          "grad_norm": 0.05224609375,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 576.6964285714286,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1420422.0,
          "completions/mean_length": 3876.125,
          "completions/min_length": 2954.0,
          "completions/max_length": 5240.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 4144.5,
          "completions/min_terminated_length": 2954.0,
          "completions/max_terminated_length": 5240.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.4907289147377014,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.33322080969810486,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5091619491577148,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4585621654987335,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.5666121244430542,
          "reward_std": 0.5813743472099304,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16945160552859306,
          "cispo_clip_ratio": 0.0,
          "step_time": 1268.3584206089945,
          "entropy_control/entropy": 0.22861190022942993,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1037.530062,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1076.969644,
          "forward_backward_time": 191.278391,
          "rollout_overhead_time": 39.439582,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125
        },
        {
          "step": 48,
          "loss": 0.06532293558120728,
          "grad_norm": 0.05126953125,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.16923405788838863,
          "cispo_clip_ratio": 0.0031085670343600214,
          "step_time": 191.3939335570103,
          "entropy_control/entropy": 0.22838055826677772,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 191.284028,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.8125,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.010915946215391159,
          "grad_norm": 0.052978515625,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 725.46875,
          "thinking/budget_hit_fraction": 0.1875,
          "num_tokens": 1472574.0,
          "completions/mean_length": 3228.0,
          "completions/min_length": 1529.0,
          "completions/max_length": 4703.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3228.0,
          "completions/min_terminated_length": 1529.0,
          "completions/max_terminated_length": 4703.0,
          "tools/call_frequency": 2.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6088261604309082,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8257564306259155,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9495829343795776,
          "reward_std": 0.11487291008234024,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20170070603489876,
          "cispo_clip_ratio": 0.0,
          "step_time": 923.0098794490114,
          "entropy_control/entropy": 0.2068337830312001,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 790.636338,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 814.570624,
          "forward_backward_time": 108.329651,
          "rollout_overhead_time": 23.934286,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.822265625
        },
        {
          "step": 50,
          "loss": 0.01088174432516098,
          "grad_norm": 0.05517578125,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.20143523439764977,
          "cispo_clip_ratio": 0.0016747722693253309,
          "step_time": 108.43975785301882,
          "entropy_control/entropy": 0.20652793239727366,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 108.34081,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.00158309936523,
          "peak_reserved_gib": 77.822265625,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3348,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1698,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3442,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 2274,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2420,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3006,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8523284576243806,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4574,
          "reward_channels": {
            "native": 0.8523284576243806,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2625,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1448,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 6009,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8204653155141224,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4220,
          "reward_channels": {
            "native": 0.8204653155141224,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2719,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.7060268919310104,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2680,
          "reward_channels": {
            "native": 0.7060268919310104,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8541365354407209,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4571,
          "reward_channels": {
            "native": 0.8541365354407209,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.811786874720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5487,
          "reward_channels": {
            "native": 0.811786874720879,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8720485688510347,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6363,
          "reward_channels": {
            "native": 0.8720485688510347,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8720485688510347,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4101,
          "reward_channels": {
            "native": 0.8720485688510347,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6502053079500402,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 6425,
          "reward_channels": {
            "native": 0.6502053079500402,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.5875732130670761,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 8098,
          "reward_channels": {
            "native": 0.5875732130670761,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 8758,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4275,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5657,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.7187253233531886,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5633,
          "reward_channels": {
            "native": 0.7187253233531886,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1860,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2708,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.7503548418171574,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2149,
          "reward_channels": {
            "native": 0.7503548418171574,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2085,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2984,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2433,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1642,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 6308,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.962057681977345,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2907,
          "reward_channels": {
            "native": 0.962057681977345,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2561,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5922,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3879,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5265,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2790,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5800,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789312258",
      "mode": "thinking",
      "method": "adapo",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8184732961654663,
      "train_last10": 0.8814916849136353,
      "holdout_native": 0.62497194805629,
      "holdout_episodes": 40,
      "holdout_successes": 34,
      "mean_step_seconds": 887.1718965091598,
      "label": "DAPO + ADAPO",
      "state_at_cutoff": "complete",
      "step_hours": 12.321831895960553,
      "peak_allocated_gib": 71.76706552505493,
      "peak_reserved_gib": 79.62890625,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.62497194805629,
        "efficiency": 0.4666666666666667,
        "reliability": 0.75
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "adapo",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "dda0c6a01e93f1c0a7dc456724f5163caa61bb27098b308e5789d53649401a11",
        "entropy_holdout_episodes.jsonl": "fa9bf442b10ade0aee6c14bd1457868244b3c6aaaa2abf139febaa0dacf51a5f",
        "resolved_training_config.json": "a67d445b7631e9af0b4c7d78adf37bccb739a86923cb099854980fc46d5202ab"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -0.32585203647613525,
          "grad_norm": 0.061279296875,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1387.7308625300004,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1195.690378,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1230.57605,
          "forward_backward_time": 157.037873,
          "rollout_overhead_time": 34.885672,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": -0.32616713643074036,
          "grad_norm": 0.0634765625,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14562873356044292,
          "clip_ratio/low_mean": 0.0007928965496830642,
          "clip_ratio/low_min": 0.0007928965496830642,
          "clip_ratio/high_mean": 0.0009503347682766616,
          "clip_ratio/high_max": 0.0009503347682766616,
          "clip_ratio/region_mean": 0.0017432313179597259,
          "step_time": 157.09996648500055,
          "entropy_control/entropy": 0.2004543321347234,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.266,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.985637,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": -0.22225600481033325,
          "grad_norm": 0.064453125,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 519.0739795918367,
          "thinking/budget_hit_fraction": 0.13010204081632654,
          "num_tokens": 102698.0,
          "completions/mean_length": 3628.375,
          "completions/min_length": 2853.0,
          "completions/max_length": 6269.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3708.000244140625,
          "completions/min_terminated_length": 2853.0,
          "completions/max_terminated_length": 6269.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.10000000149011612,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5910395383834839,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.26091644167900085,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7660395503044128,
          "reward_std": 0.4036981463432312,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1909853182733059,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1628.453406299,
          "entropy_control/entropy": 0.2153525839184378,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.266,
          "entropy_control/epsilon_high_next": 0.2527,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1453.213702,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1484.423931,
          "forward_backward_time": 143.911268,
          "rollout_overhead_time": 31.210229,
          "peak_allocated_gib": 47.29379320144653,
          "peak_reserved_gib": 52.34375
        },
        {
          "step": 4,
          "loss": -0.22221553325653076,
          "grad_norm": 0.052490234375,
          "learning_rate": 9.4e-06,
          "entropy": 0.19090092182159424,
          "clip_ratio/low_mean": 0.00041991088073700666,
          "clip_ratio/low_min": 0.00041991088073700666,
          "clip_ratio/high_mean": 0.0013236310769570991,
          "clip_ratio/high_max": 0.0013236310769570991,
          "clip_ratio/region_mean": 0.0017435419576941058,
          "step_time": 144.02420915199946,
          "entropy_control/entropy": 0.21517221245654633,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2527,
          "entropy_control/epsilon_high_next": 0.24006499999999997,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 143.909696,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 47.29379320144653,
          "peak_reserved_gib": 52.34375,
          "reward": null
        },
        {
          "step": 5,
          "loss": -0.07189202308654785,
          "grad_norm": 0.06787109375,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 691.5464285714286,
          "thinking/budget_hit_fraction": 0.20357142857142857,
          "num_tokens": 152094.0,
          "completions/mean_length": 3469.5,
          "completions/min_length": 2229.0,
          "completions/max_length": 5309.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3469.5,
          "completions/min_terminated_length": 2229.0,
          "completions/max_terminated_length": 5309.0,
          "tools/call_frequency": 2.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5587122440338135,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.24098125100135803,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5208333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.24295634031295776,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7347538471221924,
          "reward_std": 0.38595905900001526,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2072792425751686,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1217.8728956439995,
          "entropy_control/entropy": 0.20896115617756297,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.24006499999999997,
          "entropy_control/epsilon_high_next": 0.22806174999999995,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 1068.010088,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1094.917518,
          "forward_backward_time": 122.849557,
          "rollout_overhead_time": 26.907429,
          "peak_allocated_gib": 47.29379320144653,
          "peak_reserved_gib": 52.361328125
        },
        {
          "step": 6,
          "loss": -0.07212880253791809,
          "grad_norm": 0.06396484375,
          "learning_rate": 9e-06,
          "entropy": 0.20731810480356216,
          "clip_ratio/low_mean": 0.0014326409436762333,
          "clip_ratio/low_min": 0.0014326409436762333,
          "clip_ratio/high_mean": 0.0015884223394095898,
          "clip_ratio/high_max": 0.0015884223394095898,
          "clip_ratio/region_mean": 0.003021063283085823,
          "step_time": 122.98436585900163,
          "entropy_control/entropy": 0.2088881614850532,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22806174999999995,
          "entropy_control/epsilon_high_next": 0.21665866249999993,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 122.869361,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 47.29379320144653,
          "peak_reserved_gib": 52.361328125,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.07044494152069092,
          "grad_norm": 0.06103515625,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 633.5765306122448,
          "thinking/budget_hit_fraction": 0.13010204081632654,
          "num_tokens": 215292.0,
          "completions/mean_length": 4432.25,
          "completions/min_length": 2256.0,
          "completions/max_length": 5572.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4432.25,
          "completions/min_terminated_length": 2256.0,
          "completions/max_terminated_length": 5572.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0357142873108387,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4606367349624634,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3070911467075348,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7498937845230103,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3393867611885071,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.7208902835845947,
          "reward_std": 0.5163019299507141,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20314441993832588,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1788.0677400999984,
          "entropy_control/entropy": 0.20750716747612813,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21665866249999993,
          "entropy_control/epsilon_high_next": 0.20582572937499993,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1500.15402,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1548.457852,
          "forward_backward_time": 239.495424,
          "rollout_overhead_time": 48.303831,
          "peak_allocated_gib": 57.35714864730835,
          "peak_reserved_gib": 63.630859375
        },
        {
          "step": 8,
          "loss": -0.07007166743278503,
          "grad_norm": 0.059814453125,
          "learning_rate": 8.6e-06,
          "entropy": 0.20309989154338837,
          "clip_ratio/low_mean": 0.0004893832956440747,
          "clip_ratio/low_min": 0.0004893832956440747,
          "clip_ratio/high_mean": 0.003914013446774334,
          "clip_ratio/high_max": 0.003914013446774334,
          "clip_ratio/region_mean": 0.004403396742418408,
          "step_time": 239.61313570199945,
          "entropy_control/entropy": 0.20740975057343733,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.20582572937499993,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 239.502459,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 57.35714864730835,
          "peak_reserved_gib": 63.630859375,
          "reward": null
        },
        {
          "step": 9,
          "loss": -0.1880415380001068,
          "grad_norm": 0.05224609375,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 653.8630952380953,
          "thinking/budget_hit_fraction": 0.16581632653061223,
          "num_tokens": 278150.0,
          "completions/mean_length": 4573.25,
          "completions/min_length": 2480.0,
          "completions/max_length": 8169.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4787.857421875,
          "completions/min_terminated_length": 2480.0,
          "completions/max_terminated_length": 8169.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.07999999821186066,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.4571598172187805,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.304773211479187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.8117247819900513,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12323763966560364,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8042340278625488,
          "reward_std": 0.4230191707611084,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1853284016251564,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2218.8322648449966,
          "entropy_control/entropy": 0.2157486272186285,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1826.641978,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1892.237148,
          "forward_backward_time": 326.47602,
          "rollout_overhead_time": 65.59517,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 10,
          "loss": -0.18819811940193176,
          "grad_norm": 0.051513671875,
          "learning_rate": 8.2e-06,
          "entropy": 0.1851575542241335,
          "clip_ratio/low_mean": 0.0006237653142306954,
          "clip_ratio/low_min": 0.0006237653142306954,
          "clip_ratio/high_mean": 0.003308254206785932,
          "clip_ratio/high_max": 0.003308254206785932,
          "clip_ratio/region_mean": 0.0039320195210166276,
          "step_time": 326.57490212200173,
          "entropy_control/entropy": 0.2156876346170331,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 326.455564,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.10778550058603287,
          "grad_norm": 0.052734375,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 615.225,
          "thinking/budget_hit_fraction": 0.1357142857142857,
          "num_tokens": 335818.0,
          "completions/mean_length": 3899.5,
          "completions/min_length": 1089.0,
          "completions/max_length": 9936.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3899.5,
          "completions/min_terminated_length": 1089.0,
          "completions/max_terminated_length": 9936.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6111614108085632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.4107462167739868,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2309536188840866,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3042903244495392,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.6859537959098816,
          "reward_std": 0.30306175351142883,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2010525595396757,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2242.83903173,
          "entropy_control/entropy": 0.19583375305031564,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.21000000000000002,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1923.133504,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1977.342599,
          "forward_backward_time": 265.39298,
          "rollout_overhead_time": 54.209095,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 12,
          "loss": 0.10798507183790207,
          "grad_norm": 0.049560546875,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.20115671306848526,
          "clip_ratio/low_mean": 0.0006724394479533657,
          "clip_ratio/low_min": 0.0006724394479533657,
          "clip_ratio/high_mean": 0.0015257851337082684,
          "clip_ratio/high_max": 0.0015257851337082684,
          "clip_ratio/region_mean": 0.002198224581661634,
          "step_time": 265.50838019799994,
          "entropy_control/entropy": 0.19599206063965324,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21000000000000002,
          "entropy_control/epsilon_high_next": 0.22050000000000003,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 265.400663,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.12117783725261688,
          "grad_norm": 0.06884765625,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 556.0612244897959,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 394460.0,
          "completions/mean_length": 4045.25,
          "completions/min_length": 1176.0,
          "completions/max_length": 6310.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4045.25,
          "completions/min_terminated_length": 1176.0,
          "completions/max_terminated_length": 6310.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.03448275849223137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.725550651550293,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1339954286813736,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.704129695892334,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1182098463177681,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.9356735348701477,
          "reward_std": 0.10756239295005798,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19102087058126926,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1917.1351157499976,
          "entropy_control/entropy": 0.20026604458137717,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22050000000000003,
          "entropy_control/epsilon_high_next": 0.20947500000000002,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1620.659739,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1671.291614,
          "forward_backward_time": 245.733358,
          "rollout_overhead_time": 50.631875,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 14,
          "loss": -0.12116202712059021,
          "grad_norm": 0.0625,
          "learning_rate": 7.4e-06,
          "entropy": 0.19114640541374683,
          "clip_ratio/low_mean": 0.0014320093032438308,
          "clip_ratio/low_min": 0.0014320093032438308,
          "clip_ratio/high_mean": 0.002373186231125146,
          "clip_ratio/high_max": 0.002373186231125146,
          "clip_ratio/region_mean": 0.003805195534368977,
          "step_time": 245.83355621399642,
          "entropy_control/entropy": 0.20042587934555045,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.20947500000000002,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 245.73045,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.24541530013084412,
          "grad_norm": 0.06298828125,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 580.2142857142857,
          "thinking/budget_hit_fraction": 0.1369047619047619,
          "num_tokens": 451538.0,
          "completions/mean_length": 3651.25,
          "completions/min_length": 1024.0,
          "completions/max_length": 6859.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4026.571533203125,
          "completions/min_terminated_length": 2063.0,
          "completions/max_terminated_length": 6859.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.32948943972587585,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.38222140073776245,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7000407576560974,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3576284945011139,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.6324734687805176,
          "reward_std": 0.5627145767211914,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18075690045952797,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1590.8704901529982,
          "entropy_control/entropy": 0.201307438755561,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1300.560626,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1349.674936,
          "forward_backward_time": 241.091042,
          "rollout_overhead_time": 49.11431,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 16,
          "loss": -0.24518853425979614,
          "grad_norm": 0.059814453125,
          "learning_rate": 7e-06,
          "entropy": 0.1812347825616598,
          "clip_ratio/low_mean": 0.0004967123823007569,
          "clip_ratio/low_min": 0.0004967123823007569,
          "clip_ratio/high_mean": 0.002570429176557809,
          "clip_ratio/high_max": 0.002570429176557809,
          "clip_ratio/region_mean": 0.003067141558858566,
          "step_time": 241.17334455400123,
          "entropy_control/entropy": 0.2017987437893315,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 241.068307,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.5237339735031128,
          "grad_norm": 0.061279296875,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 544.2440476190476,
          "thinking/budget_hit_fraction": 0.13095238095238096,
          "num_tokens": 512227.0,
          "completions/mean_length": 3895.125,
          "completions/min_length": 1265.0,
          "completions/max_length": 6062.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 4169.83349609375,
          "completions/min_terminated_length": 1265.0,
          "completions/max_terminated_length": 6062.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3977721333503723,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.46304839849472046,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7884960174560547,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.20735859870910645,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7066757678985596,
          "reward_std": 0.5743606090545654,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.13210453558713198,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1761.454811356005,
          "entropy_control/entropy": 0.17669977463671643,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.21000000000000002,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1418.497371,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1476.009611,
          "forward_backward_time": 285.340178,
          "rollout_overhead_time": 57.51224,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 18,
          "loss": -0.5241345167160034,
          "grad_norm": 0.056884765625,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.13225947506725788,
          "clip_ratio/low_mean": 0.0009709621663205326,
          "clip_ratio/low_min": 0.0009709621663205326,
          "clip_ratio/high_mean": 0.0020131196943111718,
          "clip_ratio/high_max": 0.0020131196943111718,
          "clip_ratio/region_mean": 0.0029840818606317043,
          "step_time": 285.45596249799564,
          "entropy_control/entropy": 0.17665275834403102,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21000000000000002,
          "entropy_control/epsilon_high_next": 0.22050000000000003,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 285.352041,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.11047493666410446,
          "grad_norm": 0.04833984375,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 675.4285714285714,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 571537.0,
          "completions/mean_length": 4523.25,
          "completions/min_length": 1649.0,
          "completions/max_length": 7480.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4523.25,
          "completions/min_terminated_length": 1649.0,
          "completions/max_terminated_length": 7480.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0357142873108387,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6096870303153992,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5707845687866211,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3742716312408447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.31549492478370667,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7121108174324036,
          "reward_std": 0.4261879026889801,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1934636514633894,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1590.5798178500045,
          "entropy_control/entropy": 0.1948017890068756,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22050000000000003,
          "entropy_control/epsilon_high_next": 0.23152500000000004,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1340.513125,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1384.070744,
          "forward_backward_time": 206.407363,
          "rollout_overhead_time": 43.557619,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 20,
          "loss": 0.11036525666713715,
          "grad_norm": 0.043701171875,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.19397841580212116,
          "clip_ratio/low_mean": 0.00043536111479625106,
          "clip_ratio/low_min": 0.00043536111479625106,
          "clip_ratio/high_mean": 0.0008276761218439788,
          "clip_ratio/high_max": 0.0008276761218439788,
          "clip_ratio/region_mean": 0.0012630372366402298,
          "step_time": 206.51005599998825,
          "entropy_control/entropy": 0.19524820448367877,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23152500000000004,
          "entropy_control/epsilon_high_next": 0.24310125000000005,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 206.406227,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.38374578952789307,
          "grad_norm": 0.057861328125,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 689.5102040816327,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 632020.0,
          "completions/mean_length": 3861.375,
          "completions/min_length": 1494.0,
          "completions/max_length": 5863.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3974.285888671875,
          "completions/min_terminated_length": 1494.0,
          "completions/max_terminated_length": 5863.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.47962427139282227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.32456180453300476,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6656705737113953,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11250734329223633,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7445224523544312,
          "reward_std": 0.3886309862136841,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17417041957378387,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1799.4436993359996,
          "entropy_control/entropy": 0.20476358123306698,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.24310125000000005,
          "entropy_control/epsilon_high_next": 0.23094618750000004,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1468.484256,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1523.710427,
          "forward_backward_time": 275.628949,
          "rollout_overhead_time": 55.226171,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 22,
          "loss": -0.38404008746147156,
          "grad_norm": 0.060546875,
          "learning_rate": 5.8e-06,
          "entropy": 0.17441867664456367,
          "clip_ratio/low_mean": 0.001117232270189561,
          "clip_ratio/low_min": 0.001117232270189561,
          "clip_ratio/high_mean": 0.0018263663514517248,
          "clip_ratio/high_max": 0.0018263663514517248,
          "clip_ratio/region_mean": 0.0029435986216412857,
          "step_time": 275.7976030539976,
          "entropy_control/entropy": 0.2047466029763731,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23094618750000004,
          "entropy_control/epsilon_high_next": 0.21939887812500003,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 275.694136,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 23,
          "loss": -0.017500929534435272,
          "grad_norm": 0.07080078125,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 857.5,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 684836.0,
          "completions/mean_length": 3716.5,
          "completions/min_length": 2290.0,
          "completions/max_length": 5510.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3716.5,
          "completions/min_terminated_length": 2290.0,
          "completions/max_terminated_length": 5510.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.05000000074505806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6404144763946533,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.04312657564878464,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.662826657295227,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3252177834510803,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8818289041519165,
          "reward_std": 0.21396346390247345,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18027674406766891,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1214.9055495350003,
          "entropy_control/entropy": 0.1839382771645593,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21939887812500003,
          "entropy_control/epsilon_high_next": 0.23036882203125003,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1066.810888,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1093.354588,
          "forward_backward_time": 121.449762,
          "rollout_overhead_time": 26.5437,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 24,
          "loss": -0.01762533187866211,
          "grad_norm": 0.07080078125,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.18072561360895634,
          "clip_ratio/low_mean": 0.0012508091749623418,
          "clip_ratio/low_min": 0.0012508091749623418,
          "clip_ratio/high_mean": 0.001962777489097789,
          "clip_ratio/high_max": 0.001962777489097789,
          "clip_ratio/region_mean": 0.0032135866640601307,
          "step_time": 121.5651989240032,
          "entropy_control/entropy": 0.1844771598448184,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23036882203125003,
          "entropy_control/epsilon_high_next": 0.24188726313281253,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 121.463173,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 25,
          "loss": -0.201101154088974,
          "grad_norm": 0.06689453125,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 651.0571428571428,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 736632.0,
          "completions/mean_length": 3384.5,
          "completions/min_length": 1382.0,
          "completions/max_length": 5307.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3384.5,
          "completions/min_terminated_length": 1382.0,
          "completions/max_terminated_length": 5307.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.10526315867900848,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5191874504089355,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.3654783070087433,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6478563547134399,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07784092426300049,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7595635652542114,
          "reward_std": 0.3977477550506592,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20006831921637058,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1024.8544964600005,
          "entropy_control/entropy": 0.21341266139776957,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.24188726313281253,
          "entropy_control/epsilon_high_next": 0.2297928999761719,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 840.236188,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 872.671843,
          "forward_backward_time": 152.082744,
          "rollout_overhead_time": 32.435655,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 26,
          "loss": -0.2011522650718689,
          "grad_norm": 0.06591796875,
          "learning_rate": 5e-06,
          "entropy": 0.19986664317548275,
          "clip_ratio/low_mean": 0.0013427212252281606,
          "clip_ratio/low_min": 0.0013427212252281606,
          "clip_ratio/high_mean": 0.0019352009403519332,
          "clip_ratio/high_max": 0.0019352009403519332,
          "clip_ratio/region_mean": 0.003277922165580094,
          "step_time": 152.1805966360007,
          "entropy_control/entropy": 0.2131841554288399,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2297928999761719,
          "entropy_control/epsilon_high_next": 0.21830325497736328,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 152.079885,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 27,
          "loss": -0.16143891215324402,
          "grad_norm": 0.06787109375,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 646.45,
          "thinking/budget_hit_fraction": 0.10833333333333332,
          "num_tokens": 792291.0,
          "completions/mean_length": 3654.875,
          "completions/min_length": 1506.0,
          "completions/max_length": 6260.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3654.875,
          "completions/min_terminated_length": 1506.0,
          "completions/max_terminated_length": 6260.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.673007607460022,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07297920435667038,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.9404942393302917,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07794613391160965,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0317509174346924,
          "reward_std": 0.15252529084682465,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18070382438600063,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1710.4444454119985,
          "entropy_control/entropy": 0.17121478947137753,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21830325497736328,
          "entropy_control/epsilon_high_next": 0.22921841772623144,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1490.457345,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1528.317853,
          "forward_backward_time": 182.026363,
          "rollout_overhead_time": 37.860508,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 28,
          "loss": -0.16135908663272858,
          "grad_norm": 0.08056640625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.18029101006686687,
          "clip_ratio/low_mean": 0.0012838473194278777,
          "clip_ratio/low_min": 0.0012838473194278777,
          "clip_ratio/high_mean": 0.0024870873312465847,
          "clip_ratio/high_max": 0.0024870873312465847,
          "clip_ratio/region_mean": 0.0037709346506744623,
          "step_time": 182.1155030810005,
          "entropy_control/entropy": 0.171024284979791,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22921841772623144,
          "entropy_control/epsilon_high_next": 0.24067933861254304,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 182.008493,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.07088714092969894,
          "grad_norm": 0.06201171875,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 569.4464285714286,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 853868.0,
          "completions/mean_length": 4414.625,
          "completions/min_length": 3128.0,
          "completions/max_length": 6527.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4414.625,
          "completions/min_terminated_length": 3128.0,
          "completions/max_terminated_length": 6527.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6391764879226685,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2832109332084656,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3042903244495392,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6660953760147095,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.060347460210323334,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8224276304244995,
          "reward_std": 0.3251701891422272,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.191108962520957,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1681.9464596959988,
          "entropy_control/entropy": 0.19075258099255643,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.24067933861254304,
          "entropy_control/epsilon_high_next": 0.2527133055431702,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1386.857225,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1437.03397,
          "forward_backward_time": 244.809965,
          "rollout_overhead_time": 50.176745,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 30,
          "loss": -0.07075826823711395,
          "grad_norm": 0.060302734375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.19117097929120064,
          "clip_ratio/low_mean": 0.0006441471632570028,
          "clip_ratio/low_min": 0.0006441471632570028,
          "clip_ratio/high_mean": 0.0010533519234741107,
          "clip_ratio/high_max": 0.0010533519234741107,
          "clip_ratio/region_mean": 0.0016974990867311135,
          "step_time": 244.9255358420014,
          "entropy_control/entropy": 0.1908541491110437,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2527133055431702,
          "entropy_control/epsilon_high_next": 0.2653489708203287,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 244.819153,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 31,
          "loss": -0.0906260535120964,
          "grad_norm": 0.08154296875,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 550.4,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 903122.0,
          "completions/mean_length": 3073.25,
          "completions/min_length": 1155.0,
          "completions/max_length": 4391.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3073.25,
          "completions/min_terminated_length": 1155.0,
          "completions/max_terminated_length": 4391.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.04545454680919647,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.862329363822937,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06961258500814438,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.12400397658348083,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.090454339981079,
          "reward_std": 0.06799826771020889,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17278917878866196,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1001.1734930269995,
          "entropy_control/entropy": 0.1790868654981576,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2653489708203287,
          "entropy_control/epsilon_high_next": 0.2786164193613452,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 839.902116,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 868.566563,
          "forward_backward_time": 132.502458,
          "rollout_overhead_time": 28.664448,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 32,
          "loss": -0.09048309922218323,
          "grad_norm": 0.08203125,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.17249196767807007,
          "clip_ratio/low_mean": 0.002061832492472604,
          "clip_ratio/low_min": 0.002061832492472604,
          "clip_ratio/high_mean": 0.0002366217304370366,
          "clip_ratio/high_max": 0.0002366217304370366,
          "clip_ratio/region_mean": 0.0022984542229096405,
          "step_time": 132.5778156569977,
          "entropy_control/entropy": 0.17875137752195996,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2786164193613452,
          "entropy_control/epsilon_high_next": 0.29254724032941243,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 132.475599,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.11338338255882263,
          "grad_norm": 0.06689453125,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 678.3152777777779,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 958967.0,
          "completions/mean_length": 4085.125,
          "completions/min_length": 2616.0,
          "completions/max_length": 6136.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4085.125,
          "completions/min_terminated_length": 2616.0,
          "completions/max_terminated_length": 6136.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6678308844566345,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11652150750160217,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8567099571228027,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06670232862234116,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.15957118570804596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9851870536804199,
          "reward_std": 0.12486284971237183,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20331044867634773,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1482.6869959809992,
          "entropy_control/entropy": 0.20108881576114443,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.29254724032941243,
          "entropy_control/epsilon_high_next": 0.2779198783129418,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1270.347497,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1307.78921,
          "forward_backward_time": 174.792873,
          "rollout_overhead_time": 37.441713,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 34,
          "loss": -0.11310680210590363,
          "grad_norm": 0.07568359375,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.20380816981196404,
          "clip_ratio/low_mean": 0.0015240056563925464,
          "clip_ratio/low_min": 0.0015240056563925464,
          "clip_ratio/high_mean": 0.000278479463304393,
          "clip_ratio/high_max": 0.000278479463304393,
          "clip_ratio/region_mean": 0.0018024851196969394,
          "step_time": 174.89699893899888,
          "entropy_control/entropy": 0.20159983308152926,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2779198783129418,
          "entropy_control/epsilon_high_next": 0.2640238843972947,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 174.794567,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.32082635164260864,
          "grad_norm": 0.04638671875,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 843.0123809523809,
          "thinking/budget_hit_fraction": 0.22857142857142856,
          "num_tokens": 1024576.0,
          "completions/mean_length": 4338.125,
          "completions/min_length": 2393.0,
          "completions/max_length": 6076.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4519.14306640625,
          "completions/min_terminated_length": 2393.0,
          "completions/max_terminated_length": 6076.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.05000000074505806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.50920569896698,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.24889644980430603,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.263523131608963,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.9258201122283936,
          "reward": 0.6279556751251221,
          "reward_std": 0.44035667181015015,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18321112729609013,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1476.4721071010063,
          "entropy_control/entropy": 0.2186302428886329,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2640238843972947,
          "entropy_control/epsilon_high_next": 0.2508226901774299,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1236.165505,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1277.813583,
          "forward_backward_time": 198.553303,
          "rollout_overhead_time": 41.648078,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125
        },
        {
          "step": 36,
          "loss": -0.3209863007068634,
          "grad_norm": 0.0439453125,
          "learning_rate": 3e-06,
          "entropy": 0.18317675963044167,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0012614787701750174,
          "clip_ratio/high_max": 0.0012614787701750174,
          "clip_ratio/region_mean": 0.0012614787701750174,
          "step_time": 198.67015630999958,
          "entropy_control/entropy": 0.218624029132364,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2508226901774299,
          "entropy_control/epsilon_high_next": 0.2382815556685584,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 198.558416,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.626953125,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.054933544248342514,
          "grad_norm": 0.07470703125,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 864.75,
          "thinking/budget_hit_fraction": 0.21875,
          "num_tokens": 1077659.0,
          "completions/mean_length": 3755.375,
          "completions/min_length": 2668.0,
          "completions/max_length": 4991.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3755.375,
          "completions/min_terminated_length": 2668.0,
          "completions/max_terminated_length": 4991.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.05000000074505806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6097036004066467,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7660998106002808,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.10691505670547485,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.9181100726127625,
          "reward_std": 0.10477986186742783,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2165136467665434,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1063.0183756520055,
          "entropy_control/entropy": 0.22111522776930506,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2382815556685584,
          "entropy_control/epsilon_high_next": 0.22636747788513048,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 923.867443,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 949.333476,
          "forward_backward_time": 113.572721,
          "rollout_overhead_time": 25.466033,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 38,
          "loss": -0.05470426380634308,
          "grad_norm": 0.130859375,
          "learning_rate": 2.6e-06,
          "entropy": 0.21626891754567623,
          "clip_ratio/low_mean": 0.0002055357617791742,
          "clip_ratio/low_min": 0.0002055357617791742,
          "clip_ratio/high_mean": 0.0013210960605647415,
          "clip_ratio/high_max": 0.0013210960605647415,
          "clip_ratio/region_mean": 0.0015266318223439157,
          "step_time": 113.67919772201276,
          "entropy_control/entropy": 0.22098230880714823,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22636747788513048,
          "entropy_control/epsilon_high_next": 0.21504910399087396,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 113.55989,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.26859793066978455,
          "grad_norm": 0.06689453125,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 549.5583333333333,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1131453.0,
          "completions/mean_length": 3633.25,
          "completions/min_length": 1174.0,
          "completions/max_length": 5464.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3633.25,
          "completions/min_terminated_length": 1174.0,
          "completions/max_terminated_length": 5464.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.74747633934021,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.11491075158119202,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4791666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.18766526877880096,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.9714346528053284,
          "reward_std": 0.1079513430595398,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18086103163659573,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1335.4767555669969,
          "entropy_control/entropy": 0.1890181002301508,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21504910399087396,
          "entropy_control/epsilon_high_next": 0.22580155919041767,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1100.428583,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1141.04147,
          "forward_backward_time": 194.333393,
          "rollout_overhead_time": 40.612888,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 40,
          "loss": -0.26867029070854187,
          "grad_norm": 0.0673828125,
          "learning_rate": 2.2e-06,
          "entropy": 0.18077907338738441,
          "clip_ratio/low_mean": 0.0008553312727599405,
          "clip_ratio/low_min": 0.0008553312727599405,
          "clip_ratio/high_mean": 0.00214733014581725,
          "clip_ratio/high_max": 0.00214733014581725,
          "clip_ratio/region_mean": 0.0030026614185771905,
          "step_time": 194.4316224219947,
          "entropy_control/entropy": 0.18876167534824811,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22580155919041767,
          "entropy_control/epsilon_high_next": 0.23709163714993856,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 194.31877,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.1159663125872612,
          "grad_norm": 0.046630859375,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 817.8630952380953,
          "thinking/budget_hit_fraction": 0.2619047619047619,
          "num_tokens": 1200270.0,
          "completions/mean_length": 5125.125,
          "completions/min_length": 3071.0,
          "completions/max_length": 6806.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5418.57177734375,
          "completions/min_terminated_length": 3133.0,
          "completions/max_terminated_length": 6806.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5503982305526733,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.40622156858444214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.71760094165802,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.11173579841852188,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8027495741844177,
          "reward_std": 0.4265289008617401,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20343837141990662,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1858.2825202210006,
          "entropy_control/entropy": 0.2303477592256566,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.23709163714993856,
          "entropy_control/epsilon_high_next": 0.22523705529244162,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1556.781741,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1607.940264,
          "forward_backward_time": 250.235761,
          "rollout_overhead_time": 51.158524,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 42,
          "loss": -0.11591409891843796,
          "grad_norm": 0.04248046875,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.2033819518983364,
          "clip_ratio/low_mean": 0.0005881242686882615,
          "clip_ratio/low_min": 0.0005881242686882615,
          "clip_ratio/high_mean": 0.0019081929058302194,
          "clip_ratio/high_max": 0.0019081929058302194,
          "clip_ratio/region_mean": 0.002496317174518481,
          "step_time": 250.3050878659924,
          "entropy_control/entropy": 0.2303099920568688,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22523705529244162,
          "entropy_control/epsilon_high_next": 0.2139752025278195,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 250.196043,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.09850254654884338,
          "grad_norm": 0.05126953125,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 637.2821428571428,
          "thinking/budget_hit_fraction": 0.1,
          "num_tokens": 1250821.0,
          "completions/mean_length": 3014.875,
          "completions/min_length": 1675.0,
          "completions/max_length": 4096.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3014.875,
          "completions/min_terminated_length": 1675.0,
          "completions/max_terminated_length": 4096.0,
          "tools/call_frequency": 2.125,
          "tools/failure_frequency": 0.05882352963089943,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.610934853553772,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.548965334892273,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.40477925539016724,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.7570334672927856,
          "reward_std": 0.40556252002716064,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21251165866851807,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 975.4812457649969,
          "entropy_control/entropy": 0.21498346984857497,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2139752025278195,
          "entropy_control/epsilon_high_next": 0.20327644240142853,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 799.469618,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 830.851928,
          "forward_backward_time": 144.525428,
          "rollout_overhead_time": 31.38231,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 44,
          "loss": -0.09850792586803436,
          "grad_norm": 0.051025390625,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.212388776242733,
          "clip_ratio/low_mean": 0.00038839978515170515,
          "clip_ratio/low_min": 0.00038839978515170515,
          "clip_ratio/high_mean": 0.0023090573376975954,
          "clip_ratio/high_max": 0.0023090573376975954,
          "clip_ratio/region_mean": 0.0026974571228493005,
          "step_time": 144.64556900199386,
          "entropy_control/entropy": 0.21487993369050687,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.20327644240142853,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 144.538271,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        },
        {
          "step": 45,
          "loss": 0.01590845175087452,
          "grad_norm": 0.05810546875,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 751.4166666666666,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 1318636.0,
          "completions/mean_length": 4806.875,
          "completions/min_length": 1452.0,
          "completions/max_length": 7509.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4806.875,
          "completions/min_terminated_length": 1452.0,
          "completions/max_terminated_length": 7509.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7373476624488831,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12540532648563385,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6424247026443481,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0662192702293396,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9086361527442932,
          "reward_std": 0.10019896179437637,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20502127707004547,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2023.3134895429903,
          "entropy_control/entropy": 0.2044678493637871,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1702.871336,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1757.588775,
          "forward_backward_time": 265.61732,
          "rollout_overhead_time": 54.717439,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 46,
          "loss": 0.016000889241695404,
          "grad_norm": 0.060302734375,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.20487543009221554,
          "clip_ratio/low_mean": 0.001967767399037257,
          "clip_ratio/low_min": 0.001967767399037257,
          "clip_ratio/high_mean": 0.0016679588879924268,
          "clip_ratio/high_max": 0.0016679588879924268,
          "clip_ratio/region_mean": 0.0036357262870296836,
          "step_time": 265.73495223200007,
          "entropy_control/entropy": 0.20430856135558217,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 265.628295,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        },
        {
          "step": 47,
          "loss": 0.09188379347324371,
          "grad_norm": 0.0771484375,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 510.4059523809524,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 1376992.0,
          "completions/mean_length": 4008.0,
          "completions/min_length": 1883.0,
          "completions/max_length": 6183.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4008.0,
          "completions/min_terminated_length": 1883.0,
          "completions/max_terminated_length": 6183.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.48760396242141724,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2901604175567627,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.2083333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.31549492478370667,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8249422311782837,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06404384970664978,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.20971764624118805,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.7729398012161255,
          "reward_std": 0.4533771872520447,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16416428238153458,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1709.7197918070233,
          "entropy_control/entropy": 0.1681721646306333,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.21000000000000002,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1462.965742,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1505.441768,
          "forward_backward_time": 204.17351,
          "rollout_overhead_time": 42.476026,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 48,
          "loss": 0.09163554012775421,
          "grad_norm": 0.06396484375,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.16428864933550358,
          "clip_ratio/low_mean": 0.0009273621544707566,
          "clip_ratio/low_min": 0.0009273621544707566,
          "clip_ratio/high_mean": 0.0036222787166479975,
          "clip_ratio/high_max": 0.0036222787166479975,
          "clip_ratio/region_mean": 0.004549640871118754,
          "step_time": 204.26634985800774,
          "entropy_control/entropy": 0.16840625487843042,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.21000000000000002,
          "entropy_control/epsilon_high_next": 0.22050000000000003,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 204.162215,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        },
        {
          "step": 49,
          "loss": -0.040280066430568695,
          "grad_norm": 0.064453125,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 694.0875,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 1436680.0,
          "completions/mean_length": 4170.0,
          "completions/min_length": 2453.0,
          "completions/max_length": 6379.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4170.0,
          "completions/min_terminated_length": 2453.0,
          "completions/max_terminated_length": 6379.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6862475872039795,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.08939856290817261,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8245845437049866,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0023437440395355225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.21516574919223785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9804160594940186,
          "reward_std": 0.08924110233783722,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19738993979990482,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1591.6186869769954,
          "entropy_control/entropy": 0.20175876097369605,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.22050000000000003,
          "entropy_control/epsilon_high_next": 0.20947500000000002,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 1379.444516,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1416.252849,
          "forward_backward_time": 175.254696,
          "rollout_overhead_time": 36.808333,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625
        },
        {
          "step": 50,
          "loss": -0.040061138570308685,
          "grad_norm": 0.062255859375,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.19751964323222637,
          "clip_ratio/low_mean": 0.0013465700903907418,
          "clip_ratio/low_min": 0.0013465700903907418,
          "clip_ratio/high_mean": 0.0019430930260568857,
          "clip_ratio/high_max": 0.0019430930260568857,
          "clip_ratio/region_mean": 0.0032896631164476275,
          "step_time": 175.35021079199214,
          "entropy_control/entropy": 0.20191867984365963,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.20947500000000002,
          "entropy_control/epsilon_high_next": 0.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 175.242225,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 71.76706552505493,
          "peak_reserved_gib": 79.62890625,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2224,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3204,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3807,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2653,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8523284576243806,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4987,
          "reward_channels": {
            "native": 0.8523284576243806,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8435035328689895,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4440,
          "reward_channels": {
            "native": 0.8435035328689895,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3825,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2831,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3001,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3157,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8522045135672316,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5328,
          "reward_channels": {
            "native": 0.8522045135672316,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3224,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5461,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3109,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5912,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.811786874720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4856,
          "reward_channels": {
            "native": 0.811786874720879,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4881,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5108,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 8927,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6185941887823871,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5438,
          "reward_channels": {
            "native": 0.6185941887823871,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 1,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "source_safe",
            "route_valid",
            "amount_bounded",
            "execution_success",
            "accounting_conserved",
            "positive_net_profit",
            "stress_positive",
            "native_replay",
            "verified_protocol",
            "evidence_bound",
            "finalized",
            "effective_work",
            "task_complete"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3860,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6512057439829095,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3868,
          "reward_channels": {
            "native": 0.6512057439829095,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3557,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.7005591947284964,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 3734,
          "reward_channels": {
            "native": 0.7005591947284964,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1411,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8444084478162579,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5142,
          "reward_channels": {
            "native": 0.8444084478162579,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.7456673418171573,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 3540,
          "reward_channels": {
            "native": 0.7456673418171573,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.7352912527935178,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 5458,
          "reward_channels": {
            "native": 0.7352912527935178,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 2244,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 1872,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.739978752793518,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 2585,
          "reward_channels": {
            "native": 0.739978752793518,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3192,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3638,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4892,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4492,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2218,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3203,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5074,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789312330",
      "mode": "thinking",
      "method": "repo-r",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8284654068946838,
      "train_last10": 0.8206436157226562,
      "holdout_native": 0.646087216010387,
      "holdout_episodes": 40,
      "holdout_successes": 34,
      "mean_step_seconds": 922.4200192468194,
      "label": "DAPO + REPO-R",
      "state_at_cutoff": "complete",
      "step_hours": 12.811389156205825,
      "peak_allocated_gib": 68.00909471511841,
      "peak_reserved_gib": 75.5390625,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.646087216010387,
        "efficiency": 0.4541666666666667,
        "reliability": 0.8
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "dapo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "dapo",
        "normalization": "joint",
        "entropy_control": {
          "method": "repo_r",
          "epsilon_low": 0.2,
          "epsilon_high": 0.28,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "174e16c95109bd9333850af284778a331544bc8625e06a3b8c45112ddf77edd1",
        "entropy_holdout_episodes.jsonl": "6c53816ae490ab1264b6b65fd11d5705dbb56deeb7f6d48aeec071864bd28c3f",
        "resolved_training_config.json": "c770506d6ac33f690596f71c4b137202b3ac566a82db8a820bcfb2b2cfdd1769"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": -0.3259884715080261,
          "grad_norm": 0.061279296875,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1397.8954549800003,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1205.825887,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1240.642983,
          "forward_backward_time": 157.147441,
          "rollout_overhead_time": 34.817096,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": -0.3258787989616394,
          "grad_norm": 0.06298828125,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14511961489915848,
          "clip_ratio/low_mean": 0.0005848915170645341,
          "clip_ratio/low_min": 0.0005848915170645341,
          "clip_ratio/high_mean": 0.0006545017204189207,
          "clip_ratio/high_max": 0.0006545017204189207,
          "clip_ratio/region_mean": 0.0012393932374834549,
          "step_time": 157.18345037700055,
          "entropy_control/entropy": 0.1997818389141923,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 157.072636,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": -0.3502673804759979,
          "grad_norm": 0.07763671875,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 656.7291666666666,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 103035.0,
          "completions/mean_length": 3670.5,
          "completions/min_length": 1836.0,
          "completions/max_length": 7313.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3670.5,
          "completions/min_terminated_length": 1836.0,
          "completions/max_terminated_length": 7313.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0476190485060215,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6708315014839172,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11447126418352127,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15430335700511932,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8999981880187988,
          "reward_std": 0.10676517337560654,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20492193195968866,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1548.7683420090002,
          "entropy_control/entropy": 0.2165817376038305,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1353.74487,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1388.408148,
          "forward_backward_time": 160.264247,
          "rollout_overhead_time": 34.663278,
          "peak_allocated_gib": 50.21120643615723,
          "peak_reserved_gib": 55.546875
        },
        {
          "step": 4,
          "loss": -0.35036006569862366,
          "grad_norm": 0.0810546875,
          "learning_rate": 9.4e-06,
          "entropy": 0.20442917477339506,
          "clip_ratio/low_mean": 0.0018149314128095284,
          "clip_ratio/low_min": 0.0018149314128095284,
          "clip_ratio/high_mean": 0.00011673664994305,
          "clip_ratio/high_max": 0.00011673664994305,
          "clip_ratio/region_mean": 0.0019316680627525784,
          "step_time": 160.3734592299993,
          "entropy_control/entropy": 0.2161768356278206,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 160.274561,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 50.21120643615723,
          "peak_reserved_gib": 55.546875,
          "reward": null
        },
        {
          "step": 5,
          "loss": -0.1864038109779358,
          "grad_norm": 0.06787109375,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 645.15625,
          "thinking/budget_hit_fraction": 0.1875,
          "num_tokens": 147211.0,
          "completions/mean_length": 2817.0,
          "completions/min_length": 1370.0,
          "completions/max_length": 5240.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 2817.0,
          "completions/min_terminated_length": 1370.0,
          "completions/max_terminated_length": 5240.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0555555559694767,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6402809619903564,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.08739244937896729,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6458333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0589255727827549,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "reward": 0.8725726008415222,
          "reward_std": 0.08444617688655853,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19345584325492382,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 945.5713407839985,
          "entropy_control/entropy": 0.20152860386475172,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 815.934001,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 839.828299,
          "forward_backward_time": 105.638448,
          "rollout_overhead_time": 23.894298,
          "peak_allocated_gib": 50.21120643615723,
          "peak_reserved_gib": 55.55859375
        },
        {
          "step": 6,
          "loss": -0.18664570152759552,
          "grad_norm": 0.060791015625,
          "learning_rate": 9e-06,
          "entropy": 0.19353977404534817,
          "clip_ratio/low_mean": 0.0012533892004285008,
          "clip_ratio/low_min": 0.0012533892004285008,
          "clip_ratio/high_mean": 0.00021469464991241693,
          "clip_ratio/high_max": 0.00021469464991241693,
          "clip_ratio/region_mean": 0.0014680838503409177,
          "step_time": 105.7294935389973,
          "entropy_control/entropy": 0.20151033951591435,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 105.629041,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 50.21120643615723,
          "peak_reserved_gib": 55.55859375,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.08715154230594635,
          "grad_norm": 0.056884765625,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 712.6023809523809,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 217300.0,
          "completions/mean_length": 5293.625,
          "completions/min_length": 3090.0,
          "completions/max_length": 7621.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5293.625,
          "completions/min_terminated_length": 3090.0,
          "completions/max_terminated_length": 7621.0,
          "tools/call_frequency": 4.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6874937415122986,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12660378217697144,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.9020491242408752,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08809521794319153,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0114381313323975,
          "reward_std": 0.14690396189689636,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19253043085336685,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2190.706770779001,
          "entropy_control/entropy": 0.19304759234163033,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1870.915505,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1925.203813,
          "forward_backward_time": 265.406044,
          "rollout_overhead_time": 54.288308,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 8,
          "loss": -0.08721963316202164,
          "grad_norm": 0.054931640625,
          "learning_rate": 8.6e-06,
          "entropy": 0.19271664507687092,
          "clip_ratio/low_mean": 0.0016498293407494202,
          "clip_ratio/low_min": 0.0016498293407494202,
          "clip_ratio/high_mean": 0.0003511721297400072,
          "clip_ratio/high_max": 0.0003511721297400072,
          "clip_ratio/region_mean": 0.0020010014704894274,
          "step_time": 265.50813235699934,
          "entropy_control/entropy": 0.1932519039943739,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 265.40423,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.05990079045295715,
          "grad_norm": 0.0654296875,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 740.2291666666666,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 277354.0,
          "completions/mean_length": 4222.75,
          "completions/min_length": 3070.0,
          "completions/max_length": 7225.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4222.75,
          "completions/min_terminated_length": 3070.0,
          "completions/max_terminated_length": 7225.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.609546422958374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6306283473968506,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.05577770620584488,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.21516573429107666,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8461290597915649,
          "reward_std": 0.03769681602716446,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1999448798596859,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1576.6268515149977,
          "entropy_control/entropy": 0.19911247380742922,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1276.454583,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1327.900362,
          "forward_backward_time": 248.626321,
          "rollout_overhead_time": 51.445779,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 10,
          "loss": 0.06006348878145218,
          "grad_norm": 0.06689453125,
          "learning_rate": 8.2e-06,
          "entropy": 0.19951391220092773,
          "clip_ratio/low_mean": 0.0013390503881964833,
          "clip_ratio/low_min": 0.0013390503881964833,
          "clip_ratio/high_mean": 0.0006475002883234993,
          "clip_ratio/high_max": 0.0006475002883234993,
          "clip_ratio/region_mean": 0.0019865506765199825,
          "step_time": 248.70580136699755,
          "entropy_control/entropy": 0.1987466156907593,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 248.601753,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 11,
          "loss": -0.33186206221580505,
          "grad_norm": 0.060302734375,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 661.9261904761904,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 332088.0,
          "completions/mean_length": 3532.75,
          "completions/min_length": 1457.0,
          "completions/max_length": 4803.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3598.71435546875,
          "completions/min_terminated_length": 1457.0,
          "completions/max_terminated_length": 4803.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5509068965911865,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.4066128134727478,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6762324571609497,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07764213532209396,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7875280380249023,
          "reward_std": 0.41725409030914307,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.15983807668089867,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1366.433276806998,
          "entropy_control/entropy": 0.18736514871922605,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.004,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1175.752347,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1209.253643,
          "forward_backward_time": 157.068599,
          "rollout_overhead_time": 33.501296,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 12,
          "loss": -0.33221426606178284,
          "grad_norm": 0.0595703125,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.1599844992160797,
          "clip_ratio/low_mean": 0.0007805810600984842,
          "clip_ratio/low_min": 0.0007805810600984842,
          "clip_ratio/high_mean": 0.0007289346867764834,
          "clip_ratio/high_max": 0.0007289346867764834,
          "clip_ratio/region_mean": 0.0015095157468749676,
          "step_time": 157.17439058199852,
          "entropy_control/entropy": 0.18762194995238382,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.004,
          "entropy_control/zeta_next": 0.008,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 157.0646,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.2631528377532959,
          "grad_norm": 0.05419921875,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 638.756462585034,
          "thinking/budget_hit_fraction": 0.2122448979591837,
          "num_tokens": 394315.0,
          "completions/mean_length": 4493.375,
          "completions/min_length": 3071.0,
          "completions/max_length": 7951.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4696.57177734375,
          "completions/min_terminated_length": 3585.0,
          "completions/max_terminated_length": 7951.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7278944253921509,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1366470754146576,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.44153478741645813,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3896979093551636,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.701381266117096,
          "reward_std": 0.49392881989479065,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18411841057240963,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2238.979801022,
          "entropy_control/entropy": 0.20485563017215608,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.008,
          "entropy_control/zeta_next": 0.004,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1921.36754,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1974.973927,
          "forward_backward_time": 263.896289,
          "rollout_overhead_time": 53.606387,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 14,
          "loss": -0.2626897394657135,
          "grad_norm": 0.051025390625,
          "learning_rate": 7.4e-06,
          "entropy": 0.18377662170678377,
          "clip_ratio/low_mean": 0.0008020004752324894,
          "clip_ratio/low_min": 0.0008020004752324894,
          "clip_ratio/high_mean": 0.0006139878314570524,
          "clip_ratio/high_max": 0.0006139878314570524,
          "clip_ratio/region_mean": 0.0014159883066895418,
          "step_time": 263.99378604999947,
          "entropy_control/entropy": 0.20453749518624145,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.004,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 263.88747,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.2147071659564972,
          "grad_norm": 0.05712890625,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 570.465306122449,
          "thinking/budget_hit_fraction": 0.14540816326530612,
          "num_tokens": 454805.0,
          "completions/mean_length": 4077.75,
          "completions/min_length": 2950.0,
          "completions/max_length": 4939.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4221.57177734375,
          "completions/min_terminated_length": 2950.0,
          "completions/max_terminated_length": 4939.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5258879661560059,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3715890347957611,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.889053463935852,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07614489644765854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.876220703125,
          "reward_std": 0.45209410786628723,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18128307536244392,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1532.063953914996,
          "entropy_control/entropy": 0.20716967831794803,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1246.226957,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1294.656645,
          "forward_backward_time": 237.296763,
          "rollout_overhead_time": 48.429688,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 16,
          "loss": -0.21472179889678955,
          "grad_norm": 0.058837890625,
          "learning_rate": 7e-06,
          "entropy": 0.18125001713633537,
          "clip_ratio/low_mean": 0.0005973542865831405,
          "clip_ratio/low_min": 0.0005973542865831405,
          "clip_ratio/high_mean": 0.0006045860354788601,
          "clip_ratio/high_max": 0.0006045860354788601,
          "clip_ratio/region_mean": 0.0012019403220620006,
          "step_time": 237.40580801299984,
          "entropy_control/entropy": 0.2071025205107389,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 237.299794,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 17,
          "loss": -0.05078861117362976,
          "grad_norm": 0.0712890625,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 504.6464285714286,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 514341.0,
          "completions/mean_length": 3751.0,
          "completions/min_length": 2136.0,
          "completions/max_length": 5259.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3751.0,
          "completions/min_terminated_length": 2136.0,
          "completions/max_terminated_length": 5259.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5663875341415405,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2860962152481079,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7022275924682617,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11214153468608856,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8561825752258301,
          "reward_std": 0.2066703736782074,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21092794835567474,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1719.3857764660006,
          "entropy_control/entropy": 0.2120397044521445,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1422.643111,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1473.245488,
          "forward_backward_time": 246.033984,
          "rollout_overhead_time": 50.602377,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 18,
          "loss": -0.050790995359420776,
          "grad_norm": 0.0732421875,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.21118208207190037,
          "clip_ratio/low_mean": 0.0008529162441845983,
          "clip_ratio/low_min": 0.0008529162441845983,
          "clip_ratio/high_mean": 0.0011459748639026657,
          "clip_ratio/high_max": 0.0011459748639026657,
          "clip_ratio/region_mean": 0.001998891108087264,
          "step_time": 246.0806536239943,
          "entropy_control/entropy": 0.2123507976546537,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 245.97729,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.029592961072921753,
          "grad_norm": 0.068359375,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 714.2850000000001,
          "thinking/budget_hit_fraction": 0.175,
          "num_tokens": 568836.0,
          "completions/mean_length": 3921.375,
          "completions/min_length": 1926.0,
          "completions/max_length": 5923.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3921.375,
          "completions/min_terminated_length": 1926.0,
          "completions/max_terminated_length": 5923.0,
          "tools/call_frequency": 2.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7603124976158142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1818402260541916,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8599027395248413,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06802016496658325,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0371909141540527,
          "reward_std": 0.1342398226261139,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2082794103771448,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1175.120890283004,
          "entropy_control/entropy": 0.21819758630772168,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": -0.0001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 986.266377,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1019.209362,
          "forward_backward_time": 155.805796,
          "rollout_overhead_time": 32.942985,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 20,
          "loss": 0.029754847288131714,
          "grad_norm": 0.06396484375,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.20808766968548298,
          "clip_ratio/low_mean": 0.0012133791606174782,
          "clip_ratio/low_min": 0.0012133791606174782,
          "clip_ratio/high_mean": 0.0005690024336217903,
          "clip_ratio/high_max": 0.0005690024336217903,
          "clip_ratio/region_mean": 0.0017823815942392685,
          "step_time": 155.8805688670036,
          "entropy_control/entropy": 0.21820074963448827,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0001,
          "entropy_control/zeta_next": -0.0002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 155.780796,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 21,
          "loss": -0.31540295481681824,
          "grad_norm": 0.06494140625,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 724.3333333333334,
          "thinking/budget_hit_fraction": 0.10416666666666667,
          "num_tokens": 633899.0,
          "completions/mean_length": 4433.875,
          "completions/min_length": 1723.0,
          "completions/max_length": 7881.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4433.875,
          "completions/min_terminated_length": 1723.0,
          "completions/max_terminated_length": 7881.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.03846153989434242,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7041764259338379,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.11985881626605988,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6817549467086792,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0835287794470787,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9169240593910217,
          "reward_std": 0.08680310100317001,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20554296672344208,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1894.4528153590036,
          "entropy_control/entropy": 0.21422870491736745,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0002,
          "entropy_control/zeta_next": -0.0004,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1591.184369,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1642.459084,
          "forward_backward_time": 251.89198,
          "rollout_overhead_time": 51.274715,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 22,
          "loss": -0.31544703245162964,
          "grad_norm": 0.0625,
          "learning_rate": 5.8e-06,
          "entropy": 0.20528246276080608,
          "clip_ratio/low_mean": 0.0021731581655330956,
          "clip_ratio/low_min": 0.0021731581655330956,
          "clip_ratio/high_mean": 0.0003061480056203436,
          "clip_ratio/high_max": 0.0003061480056203436,
          "clip_ratio/region_mean": 0.002479306171153439,
          "step_time": 251.9174536130049,
          "entropy_control/entropy": 0.21406269566679018,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0004,
          "entropy_control/zeta_next": -0.0008,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 251.817624,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 23,
          "loss": -0.12085682153701782,
          "grad_norm": 0.0625,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 656.0714285714286,
          "thinking/budget_hit_fraction": 0.17261904761904762,
          "num_tokens": 691397.0,
          "completions/mean_length": 4301.75,
          "completions/min_length": 3071.0,
          "completions/max_length": 6698.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 4712.0,
          "completions/min_terminated_length": 3097.0,
          "completions/max_terminated_length": 6698.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.3634990453720093,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.4305455982685089,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.154700517654419,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6815767288208008,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2877177894115448,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.5892045497894287,
          "reward_std": 0.5939663052558899,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1555847767740488,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1628.1413750700012,
          "entropy_control/entropy": 0.21338015065453458,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0008,
          "entropy_control/zeta_next": -0.0016,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1384.163753,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1426.234478,
          "forward_backward_time": 201.796162,
          "rollout_overhead_time": 42.070724,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 24,
          "loss": -0.12096354365348816,
          "grad_norm": 0.0595703125,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.15518717840313911,
          "clip_ratio/low_mean": 0.0003359211841598153,
          "clip_ratio/low_min": 0.0003359211841598153,
          "clip_ratio/high_mean": 0.0006267605058383197,
          "clip_ratio/high_max": 0.0006267605058383197,
          "clip_ratio/region_mean": 0.000962681689998135,
          "step_time": 201.867253359007,
          "entropy_control/entropy": 0.2128140368689202,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0016,
          "entropy_control/zeta_next": -0.0032,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 201.768838,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 25,
          "loss": 0.2103634476661682,
          "grad_norm": 0.10888671875,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 435.86309523809524,
          "thinking/budget_hit_fraction": 0.05357142857142857,
          "num_tokens": 738777.0,
          "completions/mean_length": 2832.5,
          "completions/min_length": 1469.0,
          "completions/max_length": 6308.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 2832.5,
          "completions/min_terminated_length": 1469.0,
          "completions/max_terminated_length": 6308.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.043478261679410934,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6715044975280762,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12447243928909302,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5774143934249878,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.24432186782360077,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.8015427589416504,
          "reward_std": 0.32135501503944397,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19548141490668058,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1220.5425894130021,
          "entropy_control/entropy": 0.21258601135593283,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0032,
          "entropy_control/zeta_next": -0.0064,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 958.455504,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1003.67661,
          "forward_backward_time": 216.763821,
          "rollout_overhead_time": 45.221106,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 26,
          "loss": 0.21094360947608948,
          "grad_norm": 0.09814453125,
          "learning_rate": 5e-06,
          "entropy": 0.19584557320922613,
          "clip_ratio/low_mean": 0.001290573156438768,
          "clip_ratio/low_min": 0.001290573156438768,
          "clip_ratio/high_mean": 0.0009297065698774531,
          "clip_ratio/high_max": 0.0009297065698774531,
          "clip_ratio/region_mean": 0.002220279726316221,
          "step_time": 216.85135657700084,
          "entropy_control/entropy": 0.2129269318505866,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0064,
          "entropy_control/zeta_next": -0.0128,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 216.746383,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.09279686212539673,
          "grad_norm": 0.0634765625,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 602.5680272108845,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 800262.0,
          "completions/mean_length": 4383.125,
          "completions/min_length": 2033.0,
          "completions/max_length": 8346.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4383.125,
          "completions/min_terminated_length": 2033.0,
          "completions/max_terminated_length": 8346.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.1071428582072258,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.673007607460022,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07297920435667038,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6735195517539978,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3504052758216858,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.15957118570804596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8972219228744507,
          "reward_std": 0.23320473730564117,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19499888643622398,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1952.804152615994,
          "entropy_control/entropy": 0.20484359934442195,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0128,
          "entropy_control/zeta_next": -0.0256,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1690.824962,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1735.214541,
          "forward_backward_time": 217.490981,
          "rollout_overhead_time": 44.38958,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 28,
          "loss": 0.09532079100608826,
          "grad_norm": 0.08056640625,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.19523677229881287,
          "clip_ratio/low_mean": 0.0011541051499079913,
          "clip_ratio/low_min": 0.0011541051499079913,
          "clip_ratio/high_mean": 0.0008292896673083305,
          "clip_ratio/high_max": 0.0008292896673083305,
          "clip_ratio/region_mean": 0.001983394817216322,
          "step_time": 217.55828219300383,
          "entropy_control/entropy": 0.20515715360251255,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0256,
          "entropy_control/zeta_next": -0.05,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 217.457063,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 29,
          "loss": -0.18449796736240387,
          "grad_norm": 0.06298828125,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 517.373299319728,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 857417.0,
          "completions/mean_length": 3861.875,
          "completions/min_length": 1429.0,
          "completions/max_length": 6376.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3944.857421875,
          "completions/min_terminated_length": 1429.0,
          "completions/max_terminated_length": 6376.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.03703703731298447,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6719769239425659,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.12673872709274292,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5019842386245728,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.30418699979782104,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.0416666679084301,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.703647255897522,
          "reward_std": 0.41580674052238464,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16537689603865147,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1504.720339291005,
          "entropy_control/entropy": 0.18967879363501303,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.05,
          "entropy_control/zeta_next": -0.025,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1207.691629,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1258.410011,
          "forward_backward_time": 246.204273,
          "rollout_overhead_time": 50.718382,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 30,
          "loss": -0.1881130039691925,
          "grad_norm": 0.058837890625,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.16569842398166656,
          "clip_ratio/low_mean": 0.001011697924695909,
          "clip_ratio/low_min": 0.001011697924695909,
          "clip_ratio/high_mean": 0.0004280114735593088,
          "clip_ratio/high_max": 0.0004280114735593088,
          "clip_ratio/region_mean": 0.0014397093982552178,
          "step_time": 246.31147144499482,
          "entropy_control/entropy": 0.18999628573423533,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.025,
          "entropy_control/zeta_next": -0.0125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 246.208792,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.11245188862085342,
          "grad_norm": 0.060302734375,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 794.2,
          "thinking/budget_hit_fraction": 0.25,
          "num_tokens": 915998.0,
          "completions/mean_length": 4239.125,
          "completions/min_length": 2550.0,
          "completions/max_length": 7442.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4239.125,
          "completions/min_terminated_length": 2550.0,
          "completions/max_terminated_length": 7442.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7606706023216248,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.24138176441192627,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5208333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13908717036247253,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9867122769355774,
          "reward_std": 0.24179385602474213,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1865224912762642,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1519.2641041699972,
          "entropy_control/entropy": 0.19128284683263885,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0125,
          "entropy_control/zeta_next": -0.00625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1284.900645,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1325.123069,
          "forward_backward_time": 194.033613,
          "rollout_overhead_time": 40.222424,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 32,
          "loss": 0.11187267303466797,
          "grad_norm": 0.061279296875,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.18621982634067535,
          "clip_ratio/low_mean": 0.0012468731147237122,
          "clip_ratio/low_min": 0.0012468731147237122,
          "clip_ratio/high_mean": 0.000771423103287816,
          "clip_ratio/high_max": 0.000771423103287816,
          "clip_ratio/region_mean": 0.0020182962180115283,
          "step_time": 194.07235350299743,
          "entropy_control/entropy": 0.19088988400191137,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.00625,
          "entropy_control/zeta_next": -0.003125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 193.96996,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.1797182261943817,
          "grad_norm": 0.0712890625,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 686.7797619047618,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 973826.0,
          "completions/mean_length": 4333.0,
          "completions/min_length": 2403.0,
          "completions/max_length": 7804.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4333.0,
          "completions/min_terminated_length": 2403.0,
          "completions/max_terminated_length": 7804.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6666589975357056,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11417773365974426,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8620702028274536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0774177834391594,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.987281322479248,
          "reward_std": 0.1277439296245575,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17658358626067638,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1659.7578923590008,
          "entropy_control/entropy": 0.18745651616632011,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.003125,
          "entropy_control/zeta_next": -0.0015625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1391.378185,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1437.295868,
          "forward_backward_time": 222.362118,
          "rollout_overhead_time": 45.917683,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 34,
          "loss": -0.18020114302635193,
          "grad_norm": 0.06884765625,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.1765458695590496,
          "clip_ratio/low_mean": 0.0018103036418324336,
          "clip_ratio/low_min": 0.0018103036418324336,
          "clip_ratio/high_mean": 0.00023717802832834423,
          "clip_ratio/high_max": 0.00023717802832834423,
          "clip_ratio/region_mean": 0.002047481670160778,
          "step_time": 222.44440870100516,
          "entropy_control/entropy": 0.18732343816424013,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0015625,
          "entropy_control/zeta_next": -0.00078125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 222.341553,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 35,
          "loss": -0.3731302320957184,
          "grad_norm": 0.05419921875,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 865.725,
          "thinking/budget_hit_fraction": 0.2569444444444445,
          "num_tokens": 1043625.0,
          "completions/mean_length": 4861.875,
          "completions/min_length": 3071.0,
          "completions/max_length": 7109.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 5458.83349609375,
          "completions/min_terminated_length": 4089.0,
          "completions/max_terminated_length": 7109.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.514873743057251,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3303550183773041,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333134651184,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25197634100914,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.9258201122283936,
          "reward": 0.6315404176712036,
          "reward_std": 0.520806074142456,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16334183886647224,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1771.3755442619877,
          "entropy_control/entropy": 0.2196462359248013,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.00078125,
          "entropy_control/zeta_next": -0.0015625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1506.987091,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1551.99472,
          "forward_backward_time": 219.277062,
          "rollout_overhead_time": 45.007628,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 36,
          "loss": -0.37306493520736694,
          "grad_norm": 0.052734375,
          "learning_rate": 3e-06,
          "entropy": 0.1635054349899292,
          "clip_ratio/low_mean": 0.0009762152621988207,
          "clip_ratio/low_min": 0.0009762152621988207,
          "clip_ratio/high_mean": 0.0003261847305111587,
          "clip_ratio/high_max": 0.0003261847305111587,
          "clip_ratio/region_mean": 0.0013023999927099794,
          "step_time": 219.30618613000115,
          "entropy_control/entropy": 0.21990908590362296,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0015625,
          "entropy_control/zeta_next": -0.003125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 219.204383,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.23768571019172668,
          "grad_norm": 0.053955078125,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 508.3265306122449,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 1097018.0,
          "completions/mean_length": 3794.125,
          "completions/min_length": 2939.0,
          "completions/max_length": 5140.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3897.4287109375,
          "completions/min_terminated_length": 2939.0,
          "completions/max_terminated_length": 5140.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.11999999731779099,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6686257123947144,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11784413456916809,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6207844018936157,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.42944246530532837,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.21516574919223785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "reward": 0.8155384063720703,
          "reward_std": 0.42998006939888,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16481151804327965,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1172.8255403209987,
          "entropy_control/entropy": 0.1861763239960755,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.003125,
          "entropy_control/zeta_next": -0.0015625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 965.961993,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1001.937108,
          "forward_backward_time": 170.784393,
          "rollout_overhead_time": 35.975114,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 38,
          "loss": -0.23787617683410645,
          "grad_norm": 0.05078125,
          "learning_rate": 2.6e-06,
          "entropy": 0.1651085540652275,
          "clip_ratio/low_mean": 0.000696542949299328,
          "clip_ratio/low_min": 0.000696542949299328,
          "clip_ratio/high_mean": 0.000684014150465373,
          "clip_ratio/high_max": 0.000684014150465373,
          "clip_ratio/region_mean": 0.001380557099764701,
          "step_time": 170.8765211380014,
          "entropy_control/entropy": 0.18647694617464183,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0015625,
          "entropy_control/zeta_next": -0.00078125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 170.775489,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 39,
          "loss": -0.3025710880756378,
          "grad_norm": 0.05517578125,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 641.109126984127,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 1154511.0,
          "completions/mean_length": 4095.625,
          "completions/min_length": 2089.0,
          "completions/max_length": 5795.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4242.0,
          "completions/min_terminated_length": 2089.0,
          "completions/max_terminated_length": 5795.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.03999999910593033,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6562927961349487,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.283261239528656,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.3750000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.23145504295825958,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.8250428438186646,
          "reward_std": 0.424506813287735,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16697922721505165,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1411.5272268420013,
          "entropy_control/entropy": 0.20049225201811438,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.00078125,
          "entropy_control/zeta_next": -0.0015625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1190.893998,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1228.681028,
          "forward_backward_time": 182.742885,
          "rollout_overhead_time": 37.78703,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875
        },
        {
          "step": 40,
          "loss": -0.30246925354003906,
          "grad_norm": 0.08251953125,
          "learning_rate": 2.2e-06,
          "entropy": 0.16671635583043098,
          "clip_ratio/low_mean": 0.00044798235467169434,
          "clip_ratio/low_min": 0.00044798235467169434,
          "clip_ratio/high_mean": 0.0006984352257859427,
          "clip_ratio/high_max": 0.0006984352257859427,
          "clip_ratio/region_mean": 0.001146417580457637,
          "step_time": 182.75106583199522,
          "entropy_control/entropy": 0.20023103373452278,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0015625,
          "entropy_control/zeta_next": -0.003125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 182.649481,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.816951751708984,
          "peak_reserved_gib": 70.79296875,
          "reward": null
        },
        {
          "step": 41,
          "loss": -0.1452902853488922,
          "grad_norm": 0.0634765625,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 712.2908163265307,
          "thinking/budget_hit_fraction": 0.16581632653061223,
          "num_tokens": 1220760.0,
          "completions/mean_length": 4804.125,
          "completions/min_length": 3071.0,
          "completions/max_length": 8339.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5051.71435546875,
          "completions/min_terminated_length": 3120.0,
          "completions/max_terminated_length": 8339.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6815719604492188,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.09391827881336212,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.3694747984409332,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3001787066459656,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.154700517654419,
          "reward": 0.6421900987625122,
          "reward_std": 0.4515507221221924,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16480917483568192,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1962.5831768580101,
          "entropy_control/entropy": 0.186033986646413,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.003125,
          "entropy_control/zeta_next": -0.0015625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1603.018019,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1663.572094,
          "forward_backward_time": 298.905308,
          "rollout_overhead_time": 60.554075,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625
        },
        {
          "step": 42,
          "loss": -0.14536669850349426,
          "grad_norm": 0.08642578125,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.1649950724095106,
          "clip_ratio/low_mean": 0.0010179237433476374,
          "clip_ratio/low_min": 0.0010179237433476374,
          "clip_ratio/high_mean": 0.0004604757486958988,
          "clip_ratio/high_max": 0.0004604757486958988,
          "clip_ratio/region_mean": 0.0014783994920435362,
          "step_time": 298.94783146899135,
          "entropy_control/entropy": 0.1863435752899098,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0015625,
          "entropy_control/zeta_next": -0.00078125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 298.845444,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625,
          "reward": null
        },
        {
          "step": 43,
          "loss": -0.20788943767547607,
          "grad_norm": 0.07177734375,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 542.8666666666667,
          "thinking/budget_hit_fraction": 0.10416666666666667,
          "num_tokens": 1276636.0,
          "completions/mean_length": 3680.5,
          "completions/min_length": 1751.0,
          "completions/max_length": 7050.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3680.5,
          "completions/min_terminated_length": 1751.0,
          "completions/max_terminated_length": 7050.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7095590829849243,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.11388145387172699,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7581974267959595,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11220034211874008,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.20971761643886566,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.958878219127655,
          "reward_std": 0.10066084563732147,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18887744471430779,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1519.0825120040026,
          "entropy_control/entropy": 0.19871808623602302,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.00078125,
          "entropy_control/zeta_next": -0.000390625,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1251.182353,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1297.051325,
          "forward_backward_time": 221.923109,
          "rollout_overhead_time": 45.868972,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625
        },
        {
          "step": 44,
          "loss": -0.20786413550376892,
          "grad_norm": 0.07275390625,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.18883494287729263,
          "clip_ratio/low_mean": 0.001120483866543509,
          "clip_ratio/low_min": 0.001120483866543509,
          "clip_ratio/high_mean": 0.0005872241526958533,
          "clip_ratio/high_max": 0.0005872241526958533,
          "clip_ratio/region_mean": 0.0017077080192393623,
          "step_time": 221.9907098029944,
          "entropy_control/entropy": 0.19874537778473034,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.000390625,
          "entropy_control/zeta_next": -0.0001953125,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 221.8927,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625,
          "reward": null
        },
        {
          "step": 45,
          "loss": 0.06324189901351929,
          "grad_norm": 0.060791015625,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 618.2857142857143,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 1345351.0,
          "completions/mean_length": 4919.375,
          "completions/min_length": 3344.0,
          "completions/max_length": 7296.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4919.375,
          "completions/min_terminated_length": 3344.0,
          "completions/max_terminated_length": 7296.0,
          "tools/call_frequency": 4.5,
          "tools/failure_frequency": 0.0555555559694767,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.530854344367981,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.18811559677124023,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666567325592,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7914260625839233,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.06288611888885498,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8257235288619995,
          "reward_std": 0.326738178730011,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18930352851748466,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2097.171696471014,
          "entropy_control/entropy": 0.1893670189901332,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": -0.0001953125,
          "entropy_control/zeta_next": 0.0001,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1782.842777,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1836.412046,
          "forward_backward_time": 260.660002,
          "rollout_overhead_time": 53.569268,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625
        },
        {
          "step": 46,
          "loss": 0.06325738877058029,
          "grad_norm": 0.062255859375,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.18961226567626,
          "clip_ratio/low_mean": 0.0007533775205956772,
          "clip_ratio/low_min": 0.0007533775205956772,
          "clip_ratio/high_mean": 0.0007244420266943052,
          "clip_ratio/high_max": 0.0007244420266943052,
          "clip_ratio/region_mean": 0.0014778195472899824,
          "step_time": 260.7758615089988,
          "entropy_control/entropy": 0.1897029001935754,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0001,
          "entropy_control/zeta_next": 0.0002,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 260.67105,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625,
          "reward": null
        },
        {
          "step": 47,
          "loss": -0.1152733638882637,
          "grad_norm": 0.060302734375,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 591.780612244898,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 1400370.0,
          "completions/mean_length": 3590.875,
          "completions/min_length": 2267.0,
          "completions/max_length": 4957.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3665.14306640625,
          "completions/min_terminated_length": 2267.0,
          "completions/max_terminated_length": 4957.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.5786616802215576,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.24573741853237152,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6189429759979248,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.4126286804676056,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.7217190265655518,
          "reward_std": 0.5051907300949097,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.15867376886308193,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 1479.5910152529905,
          "entropy_control/entropy": 0.17867388151881314,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0002,
          "entropy_control/zeta_next": 0.0004,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1243.889404,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1284.66303,
          "forward_backward_time": 194.826885,
          "rollout_overhead_time": 40.773626,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625
        },
        {
          "step": 48,
          "loss": -0.11526072770357132,
          "grad_norm": 0.06201171875,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.15877635776996613,
          "clip_ratio/low_mean": 0.0002521686546970159,
          "clip_ratio/low_min": 0.0002521686546970159,
          "clip_ratio/high_mean": 0.0007957203561090864,
          "clip_ratio/high_max": 0.0007957203561090864,
          "clip_ratio/region_mean": 0.0010478890108061023,
          "step_time": 194.92949151098583,
          "entropy_control/entropy": 0.1788228330419891,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0004,
          "entropy_control/zeta_next": 0.0008,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 194.827027,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.00038623809814453125,
          "grad_norm": 0.06591796875,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 608.9505102040815,
          "thinking/budget_hit_fraction": 0.12755102040816327,
          "num_tokens": 1462626.0,
          "completions/mean_length": 4491.0,
          "completions/min_length": 1555.0,
          "completions/max_length": 8626.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4491.0,
          "completions/min_terminated_length": 1555.0,
          "completions/max_terminated_length": 8626.0,
          "tools/call_frequency": 3.875,
          "tools/failure_frequency": 0.09677419066429138,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6475368738174438,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07742142677307129,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.5344164371490479,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.41872403025627136,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8118100166320801,
          "reward_std": 0.2883836030960083,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17468035593628883,
          "clip_ratio/low_mean": 0.0,
          "clip_ratio/low_min": 0.0,
          "clip_ratio/high_mean": 0.0,
          "clip_ratio/high_max": 0.0,
          "clip_ratio/region_mean": 0.0,
          "step_time": 2294.3973380980024,
          "entropy_control/entropy": 0.17883179927992465,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0008,
          "entropy_control/zeta_next": 0.0016,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 2002.705896,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2051.794896,
          "forward_backward_time": 242.502166,
          "rollout_overhead_time": 49.089,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625
        },
        {
          "step": 50,
          "loss": 0.00040015578269958496,
          "grad_norm": 0.0654296875,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.1747208870947361,
          "clip_ratio/low_mean": 0.0015571884578093886,
          "clip_ratio/low_min": 0.0015571884578093886,
          "clip_ratio/high_mean": 0.0004357036086730659,
          "clip_ratio/high_max": 0.0004357036086730659,
          "clip_ratio/region_mean": 0.0019928920664824545,
          "step_time": 242.5753946049881,
          "entropy_control/entropy": 0.17884242490666238,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/zeta_used": 0.0016,
          "entropy_control/zeta_next": 0.0032,
          "entropy_control/epsilon_high_used": 0.28,
          "entropy_control/epsilon_high_next": 0.28,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 242.471038,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 68.00909471511841,
          "peak_reserved_gib": 75.5390625,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 3216,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8638203836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5453,
          "reward_channels": {
            "native": 0.8638203836248219,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8404385754973732,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4772,
          "reward_channels": {
            "native": 0.8404385754973732,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8591328836248219,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 4542,
          "reward_channels": {
            "native": 0.8591328836248219,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3848,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3149,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3178,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3020,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2891,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8204653155141224,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4826,
          "reward_channels": {
            "native": 0.8204653155141224,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.7049643139195981,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5670,
          "reward_channels": {
            "native": 0.7049643139195981,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2974,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3040,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8541365354407209,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3943,
          "reward_channels": {
            "native": 0.8541365354407209,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2252,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.811786874720879,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4686,
          "reward_channels": {
            "native": 0.811786874720879,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5983,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6455178079500401,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 7567,
          "reward_channels": {
            "native": 0.6455178079500401,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.7201719440979103,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 8462,
          "reward_channels": {
            "native": 0.7201719440979103,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 7579,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 5007,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.7053628099527464,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5674,
          "reward_channels": {
            "native": 0.7053628099527464,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.5871627452983137,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4448,
          "reward_channels": {
            "native": 0.5871627452983137,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2135,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3092,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.7503548418171574,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4223,
          "reward_channels": {
            "native": 0.7503548418171574,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 6244,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3626,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8461963597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5285,
          "reward_channels": {
            "native": 0.8461963597959128,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1475,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.8461963597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5229,
          "reward_channels": {
            "native": 0.8461963597959128,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5138,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3120,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3146,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5066,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4085,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3507,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 6,
          "model_tokens": 3594,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.7512635678492581,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4819,
          "reward_channels": {
            "native": 0.7512635678492581,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789375757",
      "mode": "thinking",
      "method": "cispo-repo-r-window5",
      "steps": 50,
      "reward_points": 25,
      "train_mean": 0.8164995121955871,
      "train_last10": 0.8331568300724029,
      "holdout_native": 0.6243359613981289,
      "holdout_episodes": 40,
      "holdout_successes": 34,
      "mean_step_seconds": 936.5844565406206,
      "label": "CISPO + REPO-R w5",
      "state_at_cutoff": "complete",
      "step_hours": 13.008117451953064,
      "peak_allocated_gib": 66.8723316192627,
      "peak_reserved_gib": 74.375,
      "extra_refill_rounds": 0.0,
      "groups_refilled": 0.0,
      "holdout_component_means": {
        "native": 0.6243359613981289,
        "efficiency": 0.4416666666666667,
        "reliability": 0.75
      },
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "cispo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "cispo",
        "normalization": "joint",
        "entropy_control": {
          "method": "repo_r",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "zeta_nonnegative": true,
          "target_window_steps": 5,
          "target_entropy": null,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": false,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "aba98f8765bf953712762b5f8032c304291aee52ab063e4068ee57d8c02ce60b",
        "entropy_holdout_episodes.jsonl": "62a9b75bed62ca558b18fe8fac7ee0a41c431d2cb5517f36250c1ff941bdd1bd",
        "resolved_training_config.json": "efca1b48973d92e27a151d9a6a73a87272cc2a3d4c801104dad5f1d53aee1e8a"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.05959773063659668,
          "grad_norm": 0.061279296875,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "cispo_clip_ratio": 0.0,
          "step_time": 1298.5827015979999,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 1.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1106.899504,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1141.579841,
          "forward_backward_time": 156.896813,
          "rollout_overhead_time": 34.680337,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": 0.05981137603521347,
          "grad_norm": 0.0634765625,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.1451741699129343,
          "cispo_clip_ratio": 0.002398241456830874,
          "step_time": 156.98477632500067,
          "entropy_control/entropy": 0.19986809630015606,
          "entropy_control/target": 0.19998298993646968,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 2.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.871494,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": -0.027710001915693283,
          "grad_norm": 0.056640625,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 802.625,
          "thinking/budget_hit_fraction": 0.27678571428571425,
          "num_tokens": 104821.0,
          "completions/mean_length": 3893.75,
          "completions/min_length": 2023.0,
          "completions/max_length": 8946.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4011.285888671875,
          "completions/min_terminated_length": 2023.0,
          "completions/max_terminated_length": 8946.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.05263157933950424,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5108565092086792,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.27986934781074524,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2519763112068176,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.6858565807342529,
          "reward_std": 0.40558508038520813,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16930530779063702,
          "cispo_clip_ratio": 0.0,
          "step_time": 1804.9482219919996,
          "entropy_control/entropy": 0.20253203749190046,
          "entropy_control/target": 0.2008326724549466,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 3.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1581.966809,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1620.83914,
          "forward_backward_time": 183.99845,
          "rollout_overhead_time": 38.872331,
          "peak_allocated_gib": 54.23228740692139,
          "peak_reserved_gib": 60.21484375
        },
        {
          "step": 4,
          "loss": -0.027300480753183365,
          "grad_norm": 0.056884765625,
          "learning_rate": 9.4e-06,
          "entropy": 0.16915154829621315,
          "cispo_clip_ratio": 0.0035100987879559398,
          "step_time": 184.09639192699933,
          "entropy_control/entropy": 0.2024014143879632,
          "entropy_control/target": 0.20122485793820075,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 4.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 183.99314,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 54.23228740692139,
          "peak_reserved_gib": 60.21484375,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.010351837612688541,
          "grad_norm": 0.05517578125,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 604.78125,
          "thinking/budget_hit_fraction": 0.1919642857142857,
          "num_tokens": 147129.0,
          "completions/mean_length": 2583.5,
          "completions/min_length": 1535.0,
          "completions/max_length": 4630.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 2583.5,
          "completions/min_terminated_length": 1535.0,
          "completions/max_terminated_length": 4630.0,
          "tools/call_frequency": 2.125,
          "tools/failure_frequency": 0.11764705926179886,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.562455415725708,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.24158011376857758,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.23464767634868622,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7405804395675659,
          "reward_std": 0.38817667961120605,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2071676291525364,
          "cispo_clip_ratio": 0.0,
          "step_time": 896.6167426029979,
          "entropy_control/entropy": 0.21937658947497593,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 801.331517,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 819.376388,
          "forward_backward_time": 77.119401,
          "rollout_overhead_time": 18.044871,
          "peak_allocated_gib": 54.23228740692139,
          "peak_reserved_gib": 60.21484375
        },
        {
          "step": 6,
          "loss": 0.010341729037463665,
          "grad_norm": 0.05224609375,
          "learning_rate": 9e-06,
          "entropy": 0.2073134146630764,
          "cispo_clip_ratio": 0.002112114743795246,
          "step_time": 77.16678110800058,
          "entropy_control/entropy": 0.21951732770760654,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 77.058135,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 54.23228740692139,
          "peak_reserved_gib": 60.21484375,
          "reward": null
        },
        {
          "step": 7,
          "loss": 0.0929565355181694,
          "grad_norm": 0.0311279296875,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 837.4722222222222,
          "thinking/budget_hit_fraction": 0.17361111111111113,
          "num_tokens": 211265.0,
          "completions/mean_length": 4549.5,
          "completions/min_length": 2944.0,
          "completions/max_length": 6572.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 5042.33349609375,
          "completions/min_terminated_length": 2944.0,
          "completions/max_terminated_length": 6572.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5304248929023743,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.35364797711372375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.21516574919223785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6533555388450623,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.44027379155158997,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3191424012184143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.7085568904876709,
          "reward_std": 0.5677993297576904,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16554154455661774,
          "cispo_clip_ratio": 0.0,
          "step_time": 1950.7574458720019,
          "entropy_control/entropy": 0.2220573221806916,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1655.079841,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1705.294165,
          "forward_backward_time": 245.354171,
          "rollout_overhead_time": 50.214325,
          "peak_allocated_gib": 61.0336332321167,
          "peak_reserved_gib": 67.94921875
        },
        {
          "step": 8,
          "loss": 0.09264954924583435,
          "grad_norm": 0.03173828125,
          "learning_rate": 8.6e-06,
          "entropy": 0.16547657921910286,
          "cispo_clip_ratio": 0.003446480754064396,
          "step_time": 245.43896711900197,
          "entropy_control/entropy": 0.22195000362938813,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.000125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 245.334972,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.0336332321167,
          "peak_reserved_gib": 67.94921875,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.0013452228158712387,
          "grad_norm": 0.05908203125,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 592.6428571428571,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 267115.0,
          "completions/mean_length": 3697.25,
          "completions/min_length": 2668.0,
          "completions/max_length": 5423.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3697.25,
          "completions/min_terminated_length": 2668.0,
          "completions/max_terminated_length": 5423.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.609546422958374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5474828481674194,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2035110741853714,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.7566396594047546,
          "reward_std": 0.2873321771621704,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20267178118228912,
          "cispo_clip_ratio": 0.0,
          "step_time": 1570.2471904950007,
          "entropy_control/entropy": 0.20323615243261975,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.000125,
          "entropy_control/zeta_next": 0.00025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1296.699372,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1343.478417,
          "forward_backward_time": 226.666845,
          "rollout_overhead_time": 46.779044,
          "peak_allocated_gib": 61.0336332321167,
          "peak_reserved_gib": 67.94921875
        },
        {
          "step": 10,
          "loss": 0.0013723522424697876,
          "grad_norm": 0.0712890625,
          "learning_rate": 8.2e-06,
          "entropy": 0.20214428007602692,
          "cispo_clip_ratio": 0.0015592083218507469,
          "step_time": 226.77468287900047,
          "entropy_control/entropy": 0.2026540667355008,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00025,
          "entropy_control/zeta_next": 0.0005,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 226.668711,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.0336332321167,
          "peak_reserved_gib": 67.94921875,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.020669659599661827,
          "grad_norm": 0.0888671875,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 526.9166666666667,
          "thinking/budget_hit_fraction": 0.1,
          "num_tokens": 317201.0,
          "completions/mean_length": 2951.75,
          "completions/min_length": 1729.0,
          "completions/max_length": 4615.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 2951.75,
          "completions/min_terminated_length": 1729.0,
          "completions/max_terminated_length": 4615.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0476190485060215,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6350884437561035,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.04785403609275818,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7017019987106323,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.11484745144844055,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.8975619077682495,
          "reward_std": 0.08460775762796402,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20168504863977432,
          "cispo_clip_ratio": 0.0,
          "step_time": 1191.7877642379972,
          "entropy_control/entropy": 0.20284171005910367,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0005,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1039.792731,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1067.322069,
          "forward_backward_time": 124.356247,
          "rollout_overhead_time": 27.529338,
          "peak_allocated_gib": 61.0336332321167,
          "peak_reserved_gib": 67.96875
        },
        {
          "step": 12,
          "loss": 0.02032589167356491,
          "grad_norm": 0.087890625,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.2027429062873125,
          "cispo_clip_ratio": 0.002254660299513489,
          "step_time": 124.46118573400054,
          "entropy_control/entropy": 0.20381974235789269,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 124.358736,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.0336332321167,
          "peak_reserved_gib": 67.96875,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.0024953139945864677,
          "grad_norm": 0.06787109375,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 610.6904761904761,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 376359.0,
          "completions/mean_length": 4109.75,
          "completions/min_length": 2108.0,
          "completions/max_length": 7360.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4109.75,
          "completions/min_terminated_length": 2108.0,
          "completions/max_terminated_length": 7360.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.03846153989434242,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7278944253921509,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1366470754146576,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5482227802276611,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.20462064445018768,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.8120169043540955,
          "reward_std": 0.32238584756851196,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18441541120409966,
          "cispo_clip_ratio": 0.0,
          "step_time": 1760.5267777860026,
          "entropy_control/entropy": 0.1900139432682572,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.004,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1456.105935,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1507.811771,
          "forward_backward_time": 252.613774,
          "rollout_overhead_time": 51.705836,
          "peak_allocated_gib": 62.163169384002686,
          "peak_reserved_gib": 68.69140625
        },
        {
          "step": 14,
          "loss": -0.0014013415202498436,
          "grad_norm": 0.06787109375,
          "learning_rate": 7.4e-06,
          "entropy": 0.1845948975533247,
          "cispo_clip_ratio": 0.004129788081627339,
          "step_time": 252.7138389949996,
          "entropy_control/entropy": 0.19006710776945815,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.004,
          "entropy_control/zeta_next": 0.008,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 252.610297,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 62.163169384002686,
          "peak_reserved_gib": 68.69140625,
          "reward": null
        },
        {
          "step": 15,
          "loss": -0.020297521725296974,
          "grad_norm": 0.050537109375,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 758.5357142857143,
          "thinking/budget_hit_fraction": 0.19642857142857142,
          "num_tokens": 450060.0,
          "completions/mean_length": 5729.125,
          "completions/min_length": 4202.0,
          "completions/max_length": 6894.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5729.125,
          "completions/min_terminated_length": 4202.0,
          "completions/max_terminated_length": 6894.0,
          "tools/call_frequency": 4.125,
          "tools/failure_frequency": 0.03030303120613098,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7659832835197449,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1288890242576599,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957118570804596,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.516674816608429,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.3525680899620056,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666567325592,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8079956769943237,
          "reward_std": 0.38156166672706604,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1951613910496235,
          "cispo_clip_ratio": 0.0,
          "step_time": 2033.3330594330037,
          "entropy_control/entropy": 0.1983596866809788,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.008,
          "entropy_control/zeta_next": 0.016,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1737.74738,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1788.325392,
          "forward_backward_time": 244.896591,
          "rollout_overhead_time": 50.578012,
          "peak_allocated_gib": 62.163169384002686,
          "peak_reserved_gib": 68.69140625
        },
        {
          "step": 16,
          "loss": -0.01815813221037388,
          "grad_norm": 0.051513671875,
          "learning_rate": 7e-06,
          "entropy": 0.19524658098816872,
          "cispo_clip_ratio": 0.002333718177396804,
          "step_time": 244.97779498899945,
          "entropy_control/entropy": 0.19852210625771613,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.016,
          "entropy_control/zeta_next": 0.032,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 244.863429,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 62.163169384002686,
          "peak_reserved_gib": 68.69140625,
          "reward": null
        },
        {
          "step": 17,
          "loss": 0.03386733680963516,
          "grad_norm": 0.055908203125,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 688.922619047619,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 519466.0,
          "completions/mean_length": 4984.75,
          "completions/min_length": 2691.0,
          "completions/max_length": 7173.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4984.75,
          "completions/min_terminated_length": 2691.0,
          "completions/max_terminated_length": 7173.0,
          "tools/call_frequency": 3.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7994208335876465,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.1643586903810501,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0833333283662796,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.556321382522583,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.21588364243507385,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.84870445728302,
          "reward_std": 0.34821492433547974,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2243624310940504,
          "cispo_clip_ratio": 0.0,
          "step_time": 1850.8885259510007,
          "entropy_control/entropy": 0.22530296515731843,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.032,
          "entropy_control/zeta_next": 0.016,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 1590.128505,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1635.09638,
          "forward_backward_time": 215.673129,
          "rollout_overhead_time": 44.967875,
          "peak_allocated_gib": 62.163169384002686,
          "peak_reserved_gib": 68.69140625
        },
        {
          "step": 18,
          "loss": 0.02839519828557968,
          "grad_norm": 0.054931640625,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.22481019608676434,
          "cispo_clip_ratio": 0.003336210415000096,
          "step_time": 215.79665486700105,
          "entropy_control/entropy": 0.22577012742912464,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.016,
          "entropy_control/zeta_next": 0.008,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 215.671206,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 62.163169384002686,
          "peak_reserved_gib": 68.69140625,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.06444666534662247,
          "grad_norm": 0.0693359375,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 622.8214285714286,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 575231.0,
          "completions/mean_length": 4080.125,
          "completions/min_length": 2023.0,
          "completions/max_length": 7409.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4080.125,
          "completions/min_terminated_length": 2023.0,
          "completions/max_terminated_length": 7409.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6687541007995605,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11813405156135559,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.902118444442749,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.08801792562007904,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.38490021228790283,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.009394645690918,
          "reward_std": 0.14584001898765564,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19914155080914497,
          "cispo_clip_ratio": 0.0,
          "step_time": 1785.1697965930034,
          "entropy_control/entropy": 0.2037297005870767,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.008,
          "entropy_control/zeta_next": 0.016,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1489.654155,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1539.884745,
          "forward_backward_time": 245.159618,
          "rollout_overhead_time": 50.23059,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 20,
          "loss": 0.06706183403730392,
          "grad_norm": 0.08056640625,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.1990173440426588,
          "cispo_clip_ratio": 0.0015563149063382298,
          "step_time": 245.27781082600268,
          "entropy_control/entropy": 0.2036310221385924,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.016,
          "entropy_control/zeta_next": 0.032,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 245.159189,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 21,
          "loss": 0.01057123951613903,
          "grad_norm": 0.059814453125,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 682.9277210884354,
          "thinking/budget_hit_fraction": 0.17857142857142858,
          "num_tokens": 645527.0,
          "completions/mean_length": 5088.0,
          "completions/min_length": 3594.0,
          "completions/max_length": 7083.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5088.0,
          "completions/min_terminated_length": 3594.0,
          "completions/max_terminated_length": 7083.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.13333334028720856,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6140941381454468,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7966060638427734,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.05463671311736107,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9282667636871338,
          "reward_std": 0.09932444244623184,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.21079818531870842,
          "cispo_clip_ratio": 0.0,
          "step_time": 2104.7825938940005,
          "entropy_control/entropy": 0.20509145250836291,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.032,
          "entropy_control/zeta_next": 0.016,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1793.906321,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1846.446981,
          "forward_backward_time": 258.226986,
          "rollout_overhead_time": 52.54066,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 22,
          "loss": 0.005065605044364929,
          "grad_norm": 0.05712890625,
          "learning_rate": 5.8e-06,
          "entropy": 0.21090805158019066,
          "cispo_clip_ratio": 0.0024892244837246835,
          "step_time": 258.36378274600065,
          "entropy_control/entropy": 0.2051834969096493,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.016,
          "entropy_control/zeta_next": 0.008,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 258.25595,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 23,
          "loss": 0.06523437798023224,
          "grad_norm": 0.0751953125,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 687.2166666666667,
          "thinking/budget_hit_fraction": 0.15,
          "num_tokens": 697274.0,
          "completions/mean_length": 3582.875,
          "completions/min_length": 2165.0,
          "completions/max_length": 5790.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3582.875,
          "completions/min_terminated_length": 2165.0,
          "completions/max_terminated_length": 5790.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6682802438735962,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11743566393852234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8887895345687866,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.07352567464113235,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.006659984588623,
          "reward_std": 0.1427164375782013,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19497286900877953,
          "cispo_clip_ratio": 0.0,
          "step_time": 1244.0834711949938,
          "entropy_control/entropy": 0.20386093177247533,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.008,
          "entropy_control/zeta_next": 0.016,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 1058.673756,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1091.555687,
          "forward_backward_time": 152.427777,
          "rollout_overhead_time": 32.881931,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 24,
          "loss": 0.06809286773204803,
          "grad_norm": 0.1025390625,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.19526192545890808,
          "cispo_clip_ratio": 0.0016663168498780578,
          "step_time": 152.53275930000018,
          "entropy_control/entropy": 0.2041409603798984,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.016,
          "entropy_control/zeta_next": 0.032,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 152.430022,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 25,
          "loss": 0.054781217128038406,
          "grad_norm": 0.06298828125,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 681.1017006802721,
          "thinking/budget_hit_fraction": 0.14795918367346936,
          "num_tokens": 758753.0,
          "completions/mean_length": 4594.875,
          "completions/min_length": 2531.0,
          "completions/max_length": 7613.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4594.875,
          "completions/min_terminated_length": 2531.0,
          "completions/max_terminated_length": 7613.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6674500703811646,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.1163635328412056,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.4114094376564026,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.35037869215011597,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.125,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.154700517654419,
          "reward": 0.658179759979248,
          "reward_std": 0.46525639295578003,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1866621244698763,
          "cispo_clip_ratio": 0.0,
          "step_time": 2135.4792062919987,
          "entropy_control/entropy": 0.18523013277229308,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.032,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1832.699307,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1884.293525,
          "forward_backward_time": 251.07364,
          "rollout_overhead_time": 51.594217,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 26,
          "loss": 0.06057373806834221,
          "grad_norm": 0.0673828125,
          "learning_rate": 5e-06,
          "entropy": 0.18667729198932648,
          "cispo_clip_ratio": 0.0015251196455210447,
          "step_time": 251.15780723399803,
          "entropy_control/entropy": 0.18529547279088113,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 251.049987,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 27,
          "loss": -0.00391291081905365,
          "grad_norm": 0.07763671875,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 517.8619047619047,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 816208.0,
          "completions/mean_length": 3879.375,
          "completions/min_length": 2891.0,
          "completions/max_length": 4980.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3879.375,
          "completions/min_terminated_length": 2891.0,
          "completions/max_terminated_length": 4980.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6411614418029785,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.26617082953453064,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3042903244495392,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.681270956993103,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.28751400113105774,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.7810078859329224,
          "reward_std": 0.45390626788139343,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17713535204529762,
          "cispo_clip_ratio": 0.0,
          "step_time": 1637.9102483940005,
          "entropy_control/entropy": 0.17816867897465358,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1376.580796,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1421.6892,
          "forward_backward_time": 216.112246,
          "rollout_overhead_time": 45.108404,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 28,
          "loss": -0.003446172922849655,
          "grad_norm": 0.07568359375,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.17688164487481117,
          "cispo_clip_ratio": 0.004137578274821863,
          "step_time": 216.23619884599975,
          "entropy_control/entropy": 0.1778971547315059,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 216.122646,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 29,
          "loss": 0.07119542360305786,
          "grad_norm": 0.458984375,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 809.1194444444445,
          "thinking/budget_hit_fraction": 0.15178571428571427,
          "num_tokens": 880463.0,
          "completions/mean_length": 4749.375,
          "completions/min_length": 3071.0,
          "completions/max_length": 7169.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 4989.14306640625,
          "completions/min_terminated_length": 3259.0,
          "completions/max_terminated_length": 7169.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.41142311692237854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.39460644125938416,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.7119555473327637,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.11502954363822937,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.7314809560775757,
          "reward_std": 0.43306535482406616,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19427763298153877,
          "cispo_clip_ratio": 0.0,
          "step_time": 1882.0860976619952,
          "entropy_control/entropy": 0.2256108444236916,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1605.322095,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1652.758794,
          "forward_backward_time": 229.217038,
          "rollout_overhead_time": 47.436699,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 30,
          "loss": 0.06267890334129333,
          "grad_norm": 0.0634765625,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.19474821910262108,
          "cispo_clip_ratio": 0.002466427569743246,
          "step_time": 229.31584244400437,
          "entropy_control/entropy": 0.22615603252093686,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.0125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 229.206883,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.004682481288909912,
          "grad_norm": 0.11083984375,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 1023.53125,
          "thinking/budget_hit_fraction": 0.28125,
          "num_tokens": 940497.0,
          "completions/mean_length": 4420.75,
          "completions/min_length": 2259.0,
          "completions/max_length": 7356.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4420.75,
          "completions/min_terminated_length": 2259.0,
          "completions/max_terminated_length": 7356.0,
          "tools/call_frequency": 2.5,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7605566382408142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2414233684539795,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0890870913863182,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.989723265171051,
          "reward_std": 0.24271216988563538,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1941378451883793,
          "cispo_clip_ratio": 0.0,
          "step_time": 1461.0723787209972,
          "entropy_control/entropy": 0.20328535505643772,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0125,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1281.218686,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1313.171535,
          "forward_backward_time": 147.795266,
          "rollout_overhead_time": 31.952849,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 32,
          "loss": 0.007850755006074905,
          "grad_norm": 0.047119140625,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.19449243694543839,
          "cispo_clip_ratio": 0.0018772510520648211,
          "step_time": 148.00937268200505,
          "entropy_control/entropy": 0.203654636444159,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 147.896003,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 33,
          "loss": -0.017484482377767563,
          "grad_norm": 0.07080078125,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 870.40625,
          "thinking/budget_hit_fraction": 0.28125,
          "num_tokens": 994370.0,
          "completions/mean_length": 3838.625,
          "completions/min_length": 2761.0,
          "completions/max_length": 5601.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3838.625,
          "completions/min_terminated_length": 2761.0,
          "completions/max_terminated_length": 5601.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6095701456069946,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8249396085739136,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.09622505307197571,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9474632143974304,
          "reward_std": 0.11408235877752304,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20731479860842228,
          "cispo_clip_ratio": 0.0,
          "step_time": 1291.4547260530017,
          "entropy_control/entropy": 0.20557631052707728,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1142.442221,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1169.44514,
          "forward_backward_time": 121.904203,
          "rollout_overhead_time": 27.002919,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375
        },
        {
          "step": 34,
          "loss": -0.02583444118499756,
          "grad_norm": 0.06787109375,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.20729834772646427,
          "cispo_clip_ratio": 0.0020852537418249995,
          "step_time": 121.99650523900709,
          "entropy_control/entropy": 0.20556026268745775,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.0125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 121.890285,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 63.00174951553345,
          "peak_reserved_gib": 69.9609375,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.06391463428735733,
          "grad_norm": 0.046630859375,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 736.1457482993197,
          "thinking/budget_hit_fraction": 0.1683673469387755,
          "num_tokens": 1065792.0,
          "completions/mean_length": 5064.75,
          "completions/min_length": 3071.0,
          "completions/max_length": 8135.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5349.57177734375,
          "completions/min_terminated_length": 3388.0,
          "completions/max_terminated_length": 8135.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.03333333507180214,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5844686031341553,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.252232164144516,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2708333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.294627845287323,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.7480102777481079,
          "reward_std": 0.3923490345478058,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17276779748499393,
          "cispo_clip_ratio": 0.0,
          "step_time": 2276.6506014410006,
          "entropy_control/entropy": 0.19601446939552125,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0125,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1927.29938,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1986.253628,
          "forward_backward_time": 290.28521,
          "rollout_overhead_time": 58.954248,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 36,
          "loss": 0.06670805811882019,
          "grad_norm": 0.07177734375,
          "learning_rate": 3e-06,
          "entropy": 0.1726672165095806,
          "cispo_clip_ratio": 0.0018082544847857207,
          "step_time": 290.36681058300746,
          "entropy_control/entropy": 0.19595297285575342,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 290.252721,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 37,
          "loss": -0.0004202350974082947,
          "grad_norm": 0.06591796875,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 637.6488095238095,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 1123206.0,
          "completions/mean_length": 4296.75,
          "completions/min_length": 1682.0,
          "completions/max_length": 7214.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4296.75,
          "completions/min_terminated_length": 1682.0,
          "completions/max_terminated_length": 7214.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.03846153989434242,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5197777152061462,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.17985181510448456,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.3499770760536194,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.41055575013160706,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "reward": 0.5515440702438354,
          "reward_std": 0.45853644609451294,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2026723064482212,
          "cispo_clip_ratio": 0.0,
          "step_time": 1781.7185949529885,
          "entropy_control/entropy": 0.20316437525962658,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 1534.11242,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1577.213866,
          "forward_backward_time": 204.400545,
          "rollout_overhead_time": 43.101447,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 38,
          "loss": -0.00047516636550426483,
          "grad_norm": 0.06982421875,
          "learning_rate": 2.6e-06,
          "entropy": 0.20305371284484863,
          "cispo_clip_ratio": 0.0031116618192754686,
          "step_time": 204.5068822660105,
          "entropy_control/entropy": 0.20365197121687217,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 204.398001,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.07694607228040695,
          "grad_norm": 0.052001953125,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 806.8958333333334,
          "thinking/budget_hit_fraction": 0.21875,
          "num_tokens": 1175392.0,
          "completions/mean_length": 3432.25,
          "completions/min_length": 2260.0,
          "completions/max_length": 4888.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3483.857177734375,
          "completions/min_terminated_length": 2260.0,
          "completions/max_terminated_length": 4888.0,
          "tools/call_frequency": 2.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.5647073984146118,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.3610021471977234,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.267261266708374,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.9258201122283936,
          "reward": 0.6855406761169434,
          "reward_std": 0.5539965033531189,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17503059096634388,
          "cispo_clip_ratio": 0.0,
          "step_time": 1117.2130076190078,
          "entropy_control/entropy": 0.2098017228977747,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 977.977568,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1003.401329,
          "forward_backward_time": 113.705469,
          "rollout_overhead_time": 25.423761,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 40,
          "loss": 0.07094622403383255,
          "grad_norm": 0.05224609375,
          "learning_rate": 2.2e-06,
          "entropy": 0.1750783771276474,
          "cispo_clip_ratio": 0.003981826244853437,
          "step_time": 113.81666151001264,
          "entropy_control/entropy": 0.20988456722929072,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.0125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 113.710954,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.0182107612490654,
          "grad_norm": 0.06494140625,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 651.6333333333333,
          "thinking/budget_hit_fraction": 0.1875,
          "num_tokens": 1237863.0,
          "completions/mean_length": 4331.875,
          "completions/min_length": 2074.0,
          "completions/max_length": 6552.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4331.875,
          "completions/min_terminated_length": 2074.0,
          "completions/max_terminated_length": 6552.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.03846153989434242,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7120382785797119,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.11710403859615326,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.19245010614395142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6516755819320679,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.05423208698630333,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.9058153033256531,
          "reward_std": 0.08276018500328064,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20266657881438732,
          "cispo_clip_ratio": 0.0,
          "step_time": 1863.9089769140119,
          "entropy_control/entropy": 0.20727977515112125,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0125,
          "entropy_control/zeta_next": 0.00625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1584.546704,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1632.753558,
          "forward_backward_time": 231.041445,
          "rollout_overhead_time": 48.206854,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 42,
          "loss": 0.016232745721936226,
          "grad_norm": 0.062255859375,
          "learning_rate": 1.8000000000000001e-06,
          "entropy": 0.20269928686320782,
          "cispo_clip_ratio": 0.0014816199545748532,
          "step_time": 231.138219371991,
          "entropy_control/entropy": 0.20735147211712707,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00625,
          "entropy_control/zeta_next": 0.003125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.168,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 231.032407,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 43,
          "loss": 0.05386475473642349,
          "grad_norm": 0.0703125,
          "learning_rate": 1.6000000000000001e-06,
          "thinking/tokens_mean": 579.7458333333333,
          "thinking/budget_hit_fraction": 0.10416666666666667,
          "num_tokens": 1294305.0,
          "completions/mean_length": 3751.25,
          "completions/min_length": 820.0,
          "completions/max_length": 5090.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3751.25,
          "completions/min_terminated_length": 820.0,
          "completions/max_terminated_length": 5090.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7556194067001343,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.1185450553894043,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.20971761643886566,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6714017987251282,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07128286361694336,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.9385105967521667,
          "reward_std": 0.09417950361967087,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19579153321683407,
          "cispo_clip_ratio": 0.0,
          "step_time": 1633.5453268820056,
          "entropy_control/entropy": 0.20656649488264806,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.003125,
          "entropy_control/zeta_next": 0.0015625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.172,
          "adapter_sync_time": 0.0,
          "generation_time": 1415.327464,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1452.835355,
          "forward_backward_time": 180.602873,
          "rollout_overhead_time": 37.50789,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 44,
          "loss": 0.05319508910179138,
          "grad_norm": 0.07080078125,
          "learning_rate": 1.4000000000000001e-06,
          "entropy": 0.195509048178792,
          "cispo_clip_ratio": 0.0021582006593234837,
          "step_time": 180.71860163799283,
          "entropy_control/entropy": 0.20638041637880689,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0015625,
          "entropy_control/zeta_next": 0.00078125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.176,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 180.61375,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 45,
          "loss": -0.008169680833816528,
          "grad_norm": 0.06494140625,
          "learning_rate": 1.2000000000000002e-06,
          "thinking/tokens_mean": 559.6845238095237,
          "thinking/budget_hit_fraction": 0.08928571428571429,
          "num_tokens": 1358171.0,
          "completions/mean_length": 4313.25,
          "completions/min_length": 1751.0,
          "completions/max_length": 7750.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4313.25,
          "completions/min_terminated_length": 1751.0,
          "completions/max_terminated_length": 7750.0,
          "tools/call_frequency": 3.625,
          "tools/failure_frequency": 0.03448275849223137,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.553654670715332,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.20938174426555634,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.2357022762298584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6731905341148376,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07375707477331161,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.28867512941360474,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7821725606918335,
          "reward_std": 0.30025607347488403,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18156417924910784,
          "cispo_clip_ratio": 0.0,
          "step_time": 2046.1135910660087,
          "entropy_control/entropy": 0.18522452547652773,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00078125,
          "entropy_control/zeta_next": 0.0015625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.18,
          "adapter_sync_time": 0.0,
          "generation_time": 1787.038514,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1832.34899,
          "forward_backward_time": 213.655498,
          "rollout_overhead_time": 45.310476,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 46,
          "loss": -0.0083540640771389,
          "grad_norm": 0.08154296875,
          "learning_rate": 1.0000000000000002e-06,
          "entropy": 0.18177321273833513,
          "cispo_clip_ratio": 0.003489038615953177,
          "step_time": 213.78865860099904,
          "entropy_control/entropy": 0.18546149322949249,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0015625,
          "entropy_control/zeta_next": 0.003125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.184,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 213.666836,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 47,
          "loss": 0.011561974883079529,
          "grad_norm": 0.07421875,
          "learning_rate": 8.000000000000001e-07,
          "thinking/tokens_mean": 588.3035714285714,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 1417345.0,
          "completions/mean_length": 4110.25,
          "completions/min_length": 1555.0,
          "completions/max_length": 7501.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4110.25,
          "completions/min_terminated_length": 1555.0,
          "completions/max_terminated_length": 7501.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6431146860122681,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.0671430230140686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6694862246513367,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.32990628480911255,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.8813004493713379,
          "reward_std": 0.22074399888515472,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18419698625802994,
          "cispo_clip_ratio": 0.0,
          "step_time": 1836.2074433269954,
          "entropy_control/entropy": 0.1833051982737068,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.003125,
          "entropy_control/zeta_next": 0.00625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.188,
          "adapter_sync_time": 0.0,
          "generation_time": 1544.144557,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1593.399081,
          "forward_backward_time": 242.694666,
          "rollout_overhead_time": 49.254524,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 48,
          "loss": 0.012772273272275925,
          "grad_norm": 0.0673828125,
          "learning_rate": 6.000000000000001e-07,
          "entropy": 0.18411483988165855,
          "cispo_clip_ratio": 0.0024980568268802017,
          "step_time": 242.80719270800182,
          "entropy_control/entropy": 0.18331591951209228,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00625,
          "entropy_control/zeta_next": 0.0125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.192,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 242.690787,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        },
        {
          "step": 49,
          "loss": 0.009742127731442451,
          "grad_norm": 0.0732421875,
          "learning_rate": 4.0000000000000003e-07,
          "thinking/tokens_mean": 691.875,
          "thinking/budget_hit_fraction": 0.2,
          "num_tokens": 1474326.0,
          "completions/mean_length": 3831.625,
          "completions/min_length": 1485.0,
          "completions/max_length": 6148.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3831.625,
          "completions/min_terminated_length": 1485.0,
          "completions/max_terminated_length": 6148.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6475368738174438,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.07742142677307129,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6971055269241333,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.353938490152359,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9014878869056702,
          "reward_std": 0.23851774632930756,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2077923733741045,
          "cispo_clip_ratio": 0.0,
          "step_time": 1400.860066737987,
          "entropy_control/entropy": 0.21604512623340566,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0125,
          "entropy_control/zeta_next": 0.00625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.196,
          "adapter_sync_time": 0.0,
          "generation_time": 1225.281319,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1256.01869,
          "forward_backward_time": 144.732648,
          "rollout_overhead_time": 30.737371,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375
        },
        {
          "step": 50,
          "loss": 0.007500660140067339,
          "grad_norm": 0.078125,
          "learning_rate": 2.0000000000000002e-07,
          "entropy": 0.20776817575097084,
          "cispo_clip_ratio": 0.002450441155815497,
          "step_time": 144.83408938099456,
          "entropy_control/entropy": 0.21604681538305054,
          "entropy_control/target": 0.20485520424555576,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00625,
          "entropy_control/zeta_next": 0.003125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.2,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 144.727252,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 66.8723316192627,
          "peak_reserved_gib": 74.375,
          "reward": null
        }
      ],
      "holdout": [
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.8404385754973732,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 1804,
          "reward_channels": {
            "native": 0.8404385754973732,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3002,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6983308425395819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 2102,
          "reward_channels": {
            "native": 0.6983308425395819,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6089882858614486,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2387,
          "reward_channels": {
            "native": 0.6089882858614486,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2008,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.6093825392865522,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2709,
          "reward_channels": {
            "native": 0.6093825392865522,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8435035328689895,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3491,
          "reward_channels": {
            "native": 0.8435035328689895,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6999976570410972,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5609,
          "reward_channels": {
            "native": 0.6999976570410972,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "two_pool_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2139,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.7049643139195981,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4642,
          "reward_channels": {
            "native": 0.7049643139195981,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4728,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.6106601460847819,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3870,
          "reward_channels": {
            "native": 0.6106601460847819,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.25,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 1,
          "model_tokens": 3362,
          "reward_channels": {
            "native": 0.25,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": [
            "finalized"
          ],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6108851248150757,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3622,
          "reward_channels": {
            "native": 0.6108851248150757,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "triangular_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "triangular_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.5875732130670761,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3741,
          "reward_channels": {
            "native": 0.5875732130670761,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.6140552238672119,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3861,
          "reward_channels": {
            "native": 0.6140552238672119,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8720485688510347,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4494,
          "reward_channels": {
            "native": 0.8720485688510347,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8720485688510347,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5776,
          "reward_channels": {
            "native": 0.8720485688510347,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 4590,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 2279,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6145108982971254,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 5650,
          "reward_channels": {
            "native": 0.6145108982971254,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "competing_cycles"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 4780,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.8397209478162578,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 6375,
          "reward_channels": {
            "native": 0.8397209478162578,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.609376392538787,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 1846,
          "reward_channels": {
            "native": 0.609376392538787,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.7503548418171574,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5100,
          "reward_channels": {
            "native": 0.7503548418171574,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.8461963597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 6286,
          "reward_channels": {
            "native": 0.8461963597959128,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8415088597959128,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 4017,
          "reward_channels": {
            "native": 0.8415088597959128,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.7352912527935178,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 5,
          "model_tokens": 3469,
          "reward_channels": {
            "native": 0.7352912527935178,
            "efficiency": 0.16666666666666663,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.6095701077161815,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3076,
          "reward_channels": {
            "native": 0.6095701077161815,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "four_hop_cycle"
        },
        {
          "seed": 900000,
          "sample": 0,
          "native_reward": 0.962057681977345,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 5182,
          "reward_channels": {
            "native": 0.962057681977345,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 1,
          "native_reward": 0.175,
          "promotion_success": false,
          "done": true,
          "errors": 0,
          "tool_steps": 4,
          "model_tokens": 8525,
          "reward_channels": {
            "native": 0.175,
            "efficiency": 0.33333333333333337,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [
            "positive_net_profit",
            "stress_positive",
            "task_complete"
          ],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 2,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3254,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900000,
          "sample": 3,
          "native_reward": 0.8262556477476042,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3609,
          "reward_channels": {
            "native": 0.8262556477476042,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 0,
          "native_reward": 0.0,
          "promotion_success": false,
          "done": false,
          "errors": 0,
          "tool_steps": 0,
          "model_tokens": 0,
          "reward_channels": {
            "native": 0.0,
            "efficiency": 0.0,
            "reliability": -1.0
          },
          "verification_level": null,
          "failed_gates": null,
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 1,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 2,
          "model_tokens": 3045,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.6666666666666667,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 2,
          "native_reward": 0.8245803237223959,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 4197,
          "reward_channels": {
            "native": 0.8245803237223959,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        },
        {
          "seed": 900001,
          "sample": 3,
          "native_reward": 0.9872132714354994,
          "promotion_success": true,
          "done": true,
          "errors": 0,
          "tool_steps": 3,
          "model_tokens": 3949,
          "reward_channels": {
            "native": 0.9872132714354994,
            "efficiency": 0.5,
            "reliability": 1.0
          },
          "verification_level": "foundry_revm_arithmetic_replay",
          "failed_gates": [],
          "family": "size_sensitive_cycle"
        }
      ]
    },
    {
      "run_id": "1789396300",
      "mode": "thinking",
      "method": "cispo-repo-r-window5-refill",
      "steps": 41,
      "reward_points": 21,
      "train_mean": 0.7908252122856322,
      "train_last10": 0.8301730066537857,
      "holdout_native": null,
      "holdout_episodes": 0,
      "holdout_successes": 0,
      "mean_step_seconds": 912.0109977337314,
      "label": "CISPO + REPO-R w5 + refill",
      "state_at_cutoff": "partial",
      "step_hours": 10.386791918634163,
      "peak_allocated_gib": 70.26109647750854,
      "peak_reserved_gib": 77.83203125,
      "extra_refill_rounds": 1.0,
      "groups_refilled": 1.0,
      "holdout_component_means": null,
      "configuration": {
        "model": {
          "id": "Qwen/Qwen3-14B",
          "revision": "40c069824f4251a91eefaf281ebe4c544efd3e18",
          "loss": "cispo",
          "algorithm": "grpo",
          "no_think": false,
          "thinking_budget_tokens": 2048,
          "lora": true,
          "quantize": true,
          "lora_r": 32,
          "lora_alpha": 64,
          "use_dora": false
        },
        "loss": "cispo",
        "normalization": "joint",
        "entropy_control": {
          "method": "repo_r",
          "epsilon_low": 0.2,
          "epsilon_high": 0.2,
          "zeta_initial": 0.001,
          "zeta_min": 0.0001,
          "zeta_max": 0.05,
          "zeta_nonnegative": true,
          "target_window_steps": 5,
          "target_entropy": null,
          "holdout_split": "benchmark",
          "holdout_seeds_per_family": 2,
          "num_iterations": 2
        },
        "dynamic_sampling": true,
        "sampling": {
          "group_size": 4,
          "temperature": 1.0,
          "max_completion_tokens": 22528,
          "top_entropy_quantile": 1.0,
          "temperature_decay_to": null
        },
        "learning_rate": 1e-05,
        "turn_max_tokens": 3072
      },
      "source_sha256": {
        "metrics.jsonl": "5635a7af48bd6216438037cd6e2b997645be9eb7b68e4b67a8d3251fc5f8847b",
        "resolved_training_config.json": "84afef7ace2e4a86ce01314335f765b25f45ed5c38912f99f8e2930869783359"
      },
      "training_steps": [
        {
          "step": 1,
          "loss": 0.07572822272777557,
          "grad_norm": 0.078125,
          "learning_rate": 1e-05,
          "thinking/tokens_mean": 606.2361111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 51975.0,
          "completions/mean_length": 3604.375,
          "completions/min_length": 2890.0,
          "completions/max_length": 6014.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 3782.166748046875,
          "completions/min_terminated_length": 2890.0,
          "completions/max_terminated_length": 6014.0,
          "tools/call_frequency": 2.25,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7262155413627625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13481803238391876,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.45231834053993225,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.526568591594696,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.154700517654419,
          "reward": 0.7080169916152954,
          "reward_std": 0.5734051465988159,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.14539151638746262,
          "cispo_clip_ratio": 0.0,
          "step_time": 1239.501060564,
          "entropy_control/entropy": 0.20009788357278327,
          "entropy_control/target": 0.20009788357278327,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 1.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.004,
          "adapter_sync_time": 0.0,
          "generation_time": 1048.524445,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1082.869805,
          "forward_backward_time": 156.543807,
          "rollout_overhead_time": 34.345361,
          "peak_allocated_gib": 46.211081981658936,
          "peak_reserved_gib": 51.38671875
        },
        {
          "step": 2,
          "loss": 0.07578127086162567,
          "grad_norm": 0.08349609375,
          "learning_rate": 9.800000000000001e-06,
          "entropy": 0.14508133009076118,
          "cispo_clip_ratio": 0.0023914053745102137,
          "step_time": 156.63328702199988,
          "entropy_control/entropy": 0.1997213626651036,
          "entropy_control/target": 0.19990962311894345,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 2.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.008,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 156.532347,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 46.689598083496094,
          "peak_reserved_gib": 51.484375,
          "reward": null
        },
        {
          "step": 3,
          "loss": 0.09946434199810028,
          "grad_norm": 0.0654296875,
          "learning_rate": 9.600000000000001e-06,
          "thinking/tokens_mean": 642.3095238095237,
          "thinking/budget_hit_fraction": 0.1726190476190476,
          "num_tokens": 103527.0,
          "completions/mean_length": 3732.0,
          "completions/min_length": 1736.0,
          "completions/max_length": 5934.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3826.4287109375,
          "completions/min_terminated_length": 1736.0,
          "completions/max_terminated_length": 5934.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.095238097012043,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5765475034713745,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2458232194185257,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4791666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.25877460837364197,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.750505805015564,
          "reward_std": 0.39041367173194885,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18255372159183025,
          "cispo_clip_ratio": 0.0,
          "step_time": 1574.8926672090001,
          "entropy_control/entropy": 0.2241447887375959,
          "entropy_control/target": 0.20798801165849426,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 3.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.012,
          "adapter_sync_time": 0.0,
          "generation_time": 1383.022687,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1416.991309,
          "forward_backward_time": 157.795754,
          "rollout_overhead_time": 33.968622,
          "peak_allocated_gib": 49.95496845245361,
          "peak_reserved_gib": 54.9609375
        },
        {
          "step": 4,
          "loss": 0.10000739991664886,
          "grad_norm": 0.06689453125,
          "learning_rate": 9.4e-06,
          "entropy": 0.18299074657261372,
          "cispo_clip_ratio": 0.0030211390694603324,
          "step_time": 157.89051116999917,
          "entropy_control/entropy": 0.22478497224881575,
          "entropy_control/target": 0.21218725180607464,
          "entropy_control/target_ready": 0.0,
          "entropy_control/target_samples": 4.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.0,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.016,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 157.792978,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 49.95496845245361,
          "peak_reserved_gib": 54.9609375,
          "reward": null
        },
        {
          "step": 5,
          "loss": 0.013005992397665977,
          "grad_norm": 0.06396484375,
          "learning_rate": 9.200000000000002e-06,
          "thinking/tokens_mean": 628.0238095238095,
          "thinking/budget_hit_fraction": 0.19047619047619047,
          "num_tokens": 153323.0,
          "completions/mean_length": 3519.5,
          "completions/min_length": 2199.0,
          "completions/max_length": 5461.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3519.5,
          "completions/min_terminated_length": 2199.0,
          "completions/max_terminated_length": 5461.0,
          "tools/call_frequency": 2.375,
          "tools/failure_frequency": 0.05263157933950424,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.5747185349464417,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.2655002176761627,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.26726123690605164,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.7497185468673706,
          "reward_std": 0.4022914469242096,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2027073223143816,
          "cispo_clip_ratio": 0.0,
          "step_time": 1087.9027467079995,
          "entropy_control/entropy": 0.2071854305056443,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0,
          "entropy_control/zeta_next": 0.001,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.02,
          "adapter_sync_time": 0.0,
          "generation_time": 880.958177,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 916.705705,
          "forward_backward_time": 171.102261,
          "rollout_overhead_time": 35.747528,
          "peak_allocated_gib": 49.95496845245361,
          "peak_reserved_gib": 55.15625
        },
        {
          "step": 6,
          "loss": 0.012761129066348076,
          "grad_norm": 0.06396484375,
          "learning_rate": 9e-06,
          "entropy": 0.20208648033440113,
          "cispo_clip_ratio": 0.003421459812670946,
          "step_time": 171.2098793110008,
          "entropy_control/entropy": 0.20650391197626736,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.001,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.024,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 171.105973,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 49.95496845245361,
          "peak_reserved_gib": 55.15625,
          "reward": null
        },
        {
          "step": 7,
          "loss": -0.01953023113310337,
          "grad_norm": 0.06103515625,
          "learning_rate": 8.8e-06,
          "thinking/tokens_mean": 816.4416666666667,
          "thinking/budget_hit_fraction": 0.225,
          "num_tokens": 216848.0,
          "completions/mean_length": 4473.125,
          "completions/min_length": 2059.0,
          "completions/max_length": 7562.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4473.125,
          "completions/min_terminated_length": 2059.0,
          "completions/max_terminated_length": 7562.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5696794986724854,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2904992997646332,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.15957120060920715,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8388867378234863,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.090998575091362,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.928241491317749,
          "reward_std": 0.24654604494571686,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18779405020177364,
          "cispo_clip_ratio": 0.0,
          "step_time": 1743.7932904109994,
          "entropy_control/entropy": 0.19367323781161366,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.004,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.028,
          "adapter_sync_time": 0.0,
          "generation_time": 1480.588623,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1525.898319,
          "forward_backward_time": 217.784316,
          "rollout_overhead_time": 45.309696,
          "peak_allocated_gib": 57.167871952056885,
          "peak_reserved_gib": 63.22265625
        },
        {
          "step": 8,
          "loss": -0.01878420077264309,
          "grad_norm": 0.06494140625,
          "learning_rate": 8.6e-06,
          "entropy": 0.18777861446142197,
          "cispo_clip_ratio": 0.002460553514538333,
          "step_time": 217.9013085759998,
          "entropy_control/entropy": 0.19359376347444454,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.004,
          "entropy_control/zeta_next": 0.008,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.032,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 217.797755,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 57.167871952056885,
          "peak_reserved_gib": 63.22265625,
          "reward": null
        },
        {
          "step": 9,
          "loss": 0.11859361827373505,
          "grad_norm": 0.042236328125,
          "learning_rate": 8.400000000000001e-06,
          "thinking/tokens_mean": 780.75,
          "thinking/budget_hit_fraction": 0.25,
          "num_tokens": 274906.0,
          "completions/mean_length": 3973.25,
          "completions/min_length": 2801.0,
          "completions/max_length": 6710.0,
          "completions/clipped_ratio": 0.25,
          "completions/mean_terminated_length": 4274.0,
          "completions/min_terminated_length": 2801.0,
          "completions/max_terminated_length": 6710.0,
          "tools/call_frequency": 1.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.4571598172187805,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.304773211479187,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.48381099104881287,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3254546523094177,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.34359216690063477,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.5923604369163513,
          "reward_std": 0.4896566569805145,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.17063424549996853,
          "cispo_clip_ratio": 0.0,
          "step_time": 1398.187785918998,
          "entropy_control/entropy": 0.230657749842964,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.008,
          "entropy_control/zeta_next": 0.004,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.036,
          "adapter_sync_time": 0.0,
          "generation_time": 1100.928635,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1151.379982,
          "forward_backward_time": 246.699895,
          "rollout_overhead_time": 50.451347,
          "peak_allocated_gib": 61.50002145767212,
          "peak_reserved_gib": 68.22265625
        },
        {
          "step": 10,
          "loss": 0.11739887297153473,
          "grad_norm": 0.042724609375,
          "learning_rate": 8.2e-06,
          "entropy": 0.17027848213911057,
          "cispo_clip_ratio": 0.0032983401615638286,
          "step_time": 246.8016796869979,
          "entropy_control/entropy": 0.23019734439087136,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.004,
          "entropy_control/zeta_next": 0.002,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.04,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 246.70414,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.50002145767212,
          "peak_reserved_gib": 68.22265625,
          "reward": null
        },
        {
          "step": 11,
          "loss": 0.06222832575440407,
          "grad_norm": 0.06591796875,
          "learning_rate": 8.000000000000001e-06,
          "thinking/tokens_mean": 617.4642857142857,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 334616.0,
          "completions/mean_length": 4154.75,
          "completions/min_length": 1584.0,
          "completions/max_length": 7545.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4154.75,
          "completions/min_terminated_length": 1584.0,
          "completions/max_terminated_length": 7545.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.07407407462596893,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7071732878684998,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.1108814924955368,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7259995937347412,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.13512180745601654,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.940544843673706,
          "reward_std": 0.10492833703756332,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19184984639286995,
          "cispo_clip_ratio": 0.0,
          "step_time": 1629.4883709589976,
          "entropy_control/entropy": 0.19991044346835185,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.002,
          "entropy_control/zeta_next": 0.004,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.044,
          "adapter_sync_time": 0.0,
          "generation_time": 1385.120445,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1427.554151,
          "forward_backward_time": 201.838395,
          "rollout_overhead_time": 42.433705,
          "peak_allocated_gib": 61.50002145767212,
          "peak_reserved_gib": 68.22265625
        },
        {
          "step": 12,
          "loss": 0.06212514638900757,
          "grad_norm": 0.0625,
          "learning_rate": 7.800000000000002e-06,
          "entropy": 0.1914893463253975,
          "cispo_clip_ratio": 0.0025537287001498044,
          "step_time": 201.96123017800164,
          "entropy_control/entropy": 0.19939919574821227,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.004,
          "entropy_control/zeta_next": 0.008,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.048,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 201.852485,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.50002145767212,
          "peak_reserved_gib": 68.22265625,
          "reward": null
        },
        {
          "step": 13,
          "loss": -0.0030301217921078205,
          "grad_norm": 0.062255859375,
          "learning_rate": 7.600000000000001e-06,
          "thinking/tokens_mean": 684.6785714285714,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 397446.0,
          "completions/mean_length": 4568.75,
          "completions/min_length": 2830.0,
          "completions/max_length": 7770.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4568.75,
          "completions/min_terminated_length": 2830.0,
          "completions/max_terminated_length": 7770.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.668724536895752,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11833984404802322,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6792972087860107,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.12803438305854797,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.8990108966827393,
          "reward_std": 0.10922113060951233,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19204666838049889,
          "cispo_clip_ratio": 0.0,
          "step_time": 1707.6739688449998,
          "entropy_control/entropy": 0.1843919927225112,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.008,
          "entropy_control/zeta_next": 0.016,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.052,
          "adapter_sync_time": 0.0,
          "generation_time": 1435.974728,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1482.796125,
          "forward_backward_time": 224.78145,
          "rollout_overhead_time": 46.821397,
          "peak_allocated_gib": 61.50002145767212,
          "peak_reserved_gib": 68.22265625
        },
        {
          "step": 14,
          "loss": -0.0010479791089892387,
          "grad_norm": 0.06005859375,
          "learning_rate": 7.4e-06,
          "entropy": 0.1921336855739355,
          "cispo_clip_ratio": 0.0009056136186700314,
          "step_time": 224.84784870800286,
          "entropy_control/entropy": 0.18457037096193685,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.016,
          "entropy_control/zeta_next": 0.032,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.056,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 224.742291,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.50002145767212,
          "peak_reserved_gib": 68.22265625,
          "reward": null
        },
        {
          "step": 15,
          "loss": 0.03000808134675026,
          "grad_norm": 0.053955078125,
          "learning_rate": 7.2000000000000005e-06,
          "thinking/tokens_mean": 814.0982142857142,
          "thinking/budget_hit_fraction": 0.1488095238095238,
          "num_tokens": 464841.0,
          "completions/mean_length": 4940.875,
          "completions/min_length": 3071.0,
          "completions/max_length": 8198.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5208.0,
          "completions/min_terminated_length": 3398.0,
          "completions/max_terminated_length": 8198.0,
          "tools/call_frequency": 3.25,
          "tools/failure_frequency": 0.07692307978868484,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.40374743938446045,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.2645609676837921,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6173950433731079,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.41159671545028687,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4166666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.2886751592159271,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.6793212890625,
          "reward_std": 0.4502282738685608,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18340378440916538,
          "cispo_clip_ratio": 0.0,
          "step_time": 1931.8897208800026,
          "entropy_control/entropy": 0.20570165910858026,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.032,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.06,
          "adapter_sync_time": 0.0,
          "generation_time": 1631.464454,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1682.396464,
          "forward_backward_time": 249.397272,
          "rollout_overhead_time": 50.93201,
          "peak_allocated_gib": 61.644176959991455,
          "peak_reserved_gib": 68.359375
        },
        {
          "step": 16,
          "loss": 0.03547542169690132,
          "grad_norm": 0.05419921875,
          "learning_rate": 7e-06,
          "entropy": 0.1832587793469429,
          "cispo_clip_ratio": 0.0033472176000941545,
          "step_time": 249.5143173660017,
          "entropy_control/entropy": 0.20542467953660967,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.064,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 249.418405,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 61.644176959991455,
          "peak_reserved_gib": 68.359375,
          "reward": null
        },
        {
          "step": 17,
          "loss": 0.0017249472439289093,
          "grad_norm": 0.053955078125,
          "learning_rate": 6.800000000000001e-06,
          "thinking/tokens_mean": 714.3630952380953,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 535380.0,
          "completions/mean_length": 5126.375,
          "completions/min_length": 1699.0,
          "completions/max_length": 9937.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 5126.375,
          "completions/min_terminated_length": 1699.0,
          "completions/max_terminated_length": 9937.0,
          "tools/call_frequency": 3.75,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5947250723838806,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.25756439566612244,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.2916666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.556321382522583,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.21588364243507385,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.6942732334136963,
          "reward_std": 0.40823739767074585,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18763641081750393,
          "cispo_clip_ratio": 0.0,
          "step_time": 2454.9009708850044,
          "entropy_control/entropy": 0.19494015099851772,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.068,
          "adapter_sync_time": 0.0,
          "generation_time": 2079.896167,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2142.749997,
          "forward_backward_time": 312.045877,
          "rollout_overhead_time": 62.853829,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 18,
          "loss": 0.001457948237657547,
          "grad_norm": 0.06005859375,
          "learning_rate": 6.600000000000001e-06,
          "entropy": 0.1876405104994774,
          "cispo_clip_ratio": 0.0045884831342846155,
          "step_time": 312.1395660230046,
          "entropy_control/entropy": 0.19493996098454794,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.072,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 312.038325,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 19,
          "loss": 0.05143576115369797,
          "grad_norm": 0.083984375,
          "learning_rate": 6.4000000000000006e-06,
          "thinking/tokens_mean": 711.5166666666667,
          "thinking/budget_hit_fraction": 0.16666666666666666,
          "num_tokens": 585154.0,
          "completions/mean_length": 3331.25,
          "completions/min_length": 1047.0,
          "completions/max_length": 5969.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3368.4287109375,
          "completions/min_terminated_length": 1047.0,
          "completions/max_terminated_length": 5969.0,
          "tools/call_frequency": 2.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.34859350323677063,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.30983424186706543,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.619419515132904,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.41294634342193604,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.6048398613929749,
          "reward_std": 0.5408963561058044,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.16084277536720037,
          "cispo_clip_ratio": 0.0,
          "step_time": 1255.3704401659998,
          "entropy_control/entropy": 0.1911744343746652,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.076,
          "adapter_sync_time": 0.0,
          "generation_time": 1091.244395,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1120.723201,
          "forward_backward_time": 134.54555,
          "rollout_overhead_time": 29.478805,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 20,
          "loss": 0.05150822177529335,
          "grad_norm": 0.0654296875,
          "learning_rate": 6.200000000000001e-06,
          "entropy": 0.1609591143205762,
          "cispo_clip_ratio": 0.003984676877735183,
          "step_time": 134.67310873000315,
          "entropy_control/entropy": 0.1913696210057772,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.08,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 134.565871,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 21,
          "loss": 0.07471884787082672,
          "grad_norm": 0.0654296875,
          "learning_rate": 6e-06,
          "thinking/tokens_mean": 714.1078571428571,
          "thinking/budget_hit_fraction": 0.10357142857142856,
          "num_tokens": 645727.0,
          "completions/mean_length": 3872.625,
          "completions/min_length": 1854.0,
          "completions/max_length": 7092.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 3987.14306640625,
          "completions/min_terminated_length": 1854.0,
          "completions/max_terminated_length": 7092.0,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.4695986807346344,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.31352829933166504,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.28463754057884216,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.7041833400726318,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.1153934895992279,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.13608276844024658,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "reward": 0.7587659955024719,
          "reward_std": 0.3966803252696991,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.19051527045667171,
          "cispo_clip_ratio": 0.0,
          "step_time": 1649.0433202029926,
          "entropy_control/entropy": 0.22611796571848017,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.084,
          "adapter_sync_time": 0.0,
          "generation_time": 1391.315053,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1435.932255,
          "forward_backward_time": 213.003064,
          "rollout_overhead_time": 44.617201,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 22,
          "loss": 0.06720726937055588,
          "grad_norm": 0.0654296875,
          "learning_rate": 5.8e-06,
          "entropy": 0.19100352749228477,
          "cispo_clip_ratio": 0.00360257487045601,
          "step_time": 213.08353274199908,
          "entropy_control/entropy": 0.22664861035666894,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.0125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.088,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 212.975308,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 23,
          "loss": -0.03625545650720596,
          "grad_norm": 0.0849609375,
          "learning_rate": 5.600000000000001e-06,
          "thinking/tokens_mean": 447.9523809523809,
          "thinking/budget_hit_fraction": 0.10714285714285714,
          "num_tokens": 695184.0,
          "completions/mean_length": 3296.625,
          "completions/min_length": 1980.0,
          "completions/max_length": 6147.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3296.625,
          "completions/min_terminated_length": 1980.0,
          "completions/max_terminated_length": 6147.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.07999999821186066,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6673699617385864,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.11561504751443863,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.25,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.6815767288208008,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2877177894115448,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 1.0,
          "reward": 0.8505150079727173,
          "reward_std": 0.3402842581272125,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1736058034002781,
          "cispo_clip_ratio": 0.0,
          "step_time": 1193.8290967089888,
          "entropy_control/entropy": 0.17548780286473117,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0125,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.092,
          "adapter_sync_time": 0.0,
          "generation_time": 970.043981,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1009.256144,
          "forward_backward_time": 184.471185,
          "rollout_overhead_time": 39.212163,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 24,
          "loss": -0.032149478793144226,
          "grad_norm": 0.08984375,
          "learning_rate": 5.400000000000001e-06,
          "entropy": 0.17358879279345274,
          "cispo_clip_ratio": 0.002499209367670119,
          "step_time": 184.58321064999473,
          "entropy_control/entropy": 0.17547268927231588,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.096,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 184.494663,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 25,
          "loss": 0.0003781411796808243,
          "grad_norm": 0.07373046875,
          "learning_rate": 5.2e-06,
          "thinking/tokens_mean": 570.8857142857142,
          "thinking/budget_hit_fraction": 0.125,
          "num_tokens": 751556.0,
          "completions/mean_length": 3956.5,
          "completions/min_length": 3004.0,
          "completions/max_length": 4727.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3956.5,
          "completions/min_terminated_length": 3004.0,
          "completions/max_terminated_length": 4727.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7263808250427246,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.15270063281059265,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.5416666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.6163347959518433,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.2627241015434265,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.4583333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.3154948949813843,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 1.0,
          "reward": 0.8463578224182129,
          "reward_std": 0.3424694538116455,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20230159349739552,
          "cispo_clip_ratio": 0.0,
          "step_time": 1197.0888584370077,
          "entropy_control/entropy": 0.20091232362194608,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.1,
          "adapter_sync_time": 0.0,
          "generation_time": 1000.48221,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1035.028993,
          "forward_backward_time": 161.951689,
          "rollout_overhead_time": 34.546783,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 26,
          "loss": 0.00022291205823421478,
          "grad_norm": 0.07177734375,
          "learning_rate": 5e-06,
          "entropy": 0.20256466418504715,
          "cispo_clip_ratio": 0.0030252868600655347,
          "step_time": 162.0502540699963,
          "entropy_control/entropy": 0.20121698974361912,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.104,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 161.945519,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 27,
          "loss": 0.00848444178700447,
          "grad_norm": 0.0712890625,
          "learning_rate": 4.800000000000001e-06,
          "thinking/tokens_mean": 505.85714285714283,
          "thinking/budget_hit_fraction": 0.07142857142857142,
          "num_tokens": 807779.0,
          "completions/mean_length": 3725.375,
          "completions/min_length": 2768.0,
          "completions/max_length": 5253.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3725.375,
          "completions/min_terminated_length": 2768.0,
          "completions/max_terminated_length": 5253.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.18518517911434174,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/mean": 0.727188229560852,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__native/std": 0.13555511832237244,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__efficiency/std": 0.235702246427536,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__four_hop_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8250280022621155,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.5833333730697632,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 1.0031914710998535,
          "reward_std": 0.09914910048246384,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1896395180374384,
          "cispo_clip_ratio": 0.0,
          "step_time": 1235.7846389290025,
          "entropy_control/entropy": 0.18774464511480862,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.108,
          "adapter_sync_time": 0.0,
          "generation_time": 1006.205013,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1046.201583,
          "forward_backward_time": 189.476789,
          "rollout_overhead_time": 39.99657,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 28,
          "loss": 0.008762340992689133,
          "grad_norm": 0.0693359375,
          "learning_rate": 4.600000000000001e-06,
          "entropy": 0.18963168933987617,
          "cispo_clip_ratio": 0.003457594779320061,
          "step_time": 189.59208594300435,
          "entropy_control/entropy": 0.18770631076593217,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.112,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 189.485055,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 29,
          "loss": 0.08357852697372437,
          "grad_norm": 0.050048828125,
          "learning_rate": 4.4e-06,
          "thinking/tokens_mean": 854.6934523809523,
          "thinking/budget_hit_fraction": 0.16964285714285712,
          "num_tokens": 872932.0,
          "completions/mean_length": 4861.625,
          "completions/min_length": 3071.0,
          "completions/max_length": 7547.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5117.4287109375,
          "completions/min_terminated_length": 3180.0,
          "completions/max_terminated_length": 7547.0,
          "tools/call_frequency": 2.875,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.7234823703765869,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.13265986740589142,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.4583333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.2500000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5158176422119141,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.3478271961212158,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3333333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.27216553688049316,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 1.0,
          "reward": 0.789441704750061,
          "reward_std": 0.4089658856391907,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.18881307914853096,
          "cispo_clip_ratio": 0.0,
          "step_time": 1960.6909793230006,
          "entropy_control/entropy": 0.2095442864458711,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.116,
          "adapter_sync_time": 0.0,
          "generation_time": 1707.781295,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1751.396552,
          "forward_backward_time": 209.185927,
          "rollout_overhead_time": 43.615257,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 30,
          "loss": 0.0832657739520073,
          "grad_norm": 0.052734375,
          "learning_rate": 4.2000000000000004e-06,
          "entropy": 0.18904010578989983,
          "cispo_clip_ratio": 0.0023134484654292464,
          "step_time": 209.2750209980004,
          "entropy_control/entropy": 0.2097417175741633,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.12,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 209.177107,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 31,
          "loss": 0.001579820178449154,
          "grad_norm": 0.0771484375,
          "learning_rate": 4.000000000000001e-06,
          "thinking/tokens_mean": 627.3452380952382,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 933130.0,
          "completions/mean_length": 4441.25,
          "completions/min_length": 3212.0,
          "completions/max_length": 6325.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4441.25,
          "completions/min_terminated_length": 3212.0,
          "completions/max_terminated_length": 6325.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.7701637744903564,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.2155686467885971,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.4375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.21707837283611298,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.9420388340950012,
          "reward_std": 0.36321714520454407,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20752463303506374,
          "cispo_clip_ratio": 0.0,
          "step_time": 1385.4100905860032,
          "entropy_control/entropy": 0.20660830092974508,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.124,
          "adapter_sync_time": 0.0,
          "generation_time": 1139.629887,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1181.757595,
          "forward_backward_time": 203.548728,
          "rollout_overhead_time": 42.127708,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 32,
          "loss": 0.0015498446300625801,
          "grad_norm": 0.0654296875,
          "learning_rate": 3.8000000000000005e-06,
          "entropy": 0.2078357059508562,
          "cispo_clip_ratio": 0.0028741663554683328,
          "step_time": 203.65134018299796,
          "entropy_control/entropy": 0.20693874506030674,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.128,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 203.544703,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 33,
          "loss": 0.050470951944589615,
          "grad_norm": 0.0888671875,
          "learning_rate": 3.6000000000000003e-06,
          "thinking/tokens_mean": 595.4236111111111,
          "thinking/budget_hit_fraction": 0.14583333333333334,
          "num_tokens": 986589.0,
          "completions/mean_length": 3786.875,
          "completions/min_length": 2352.0,
          "completions/max_length": 6311.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3786.875,
          "completions/min_terminated_length": 2352.0,
          "completions/max_terminated_length": 6311.0,
          "tools/call_frequency": 3.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6095701456069946,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.625,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0833333432674408,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/mean": 0.8785579204559326,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__native/std": 0.06635081022977829,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/mean": 0.375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__efficiency/std": 0.20971763134002686,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__size_sensitive_cycle__reliability/std": 0.0,
          "reward": 0.9690639972686768,
          "reward_std": 0.14291220903396606,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.20151151157915592,
          "cispo_clip_ratio": 0.0,
          "step_time": 1414.5700504090055,
          "entropy_control/entropy": 0.2087628544028924,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.132,
          "adapter_sync_time": 0.0,
          "generation_time": 1220.409603,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1254.805871,
          "forward_backward_time": 159.672002,
          "rollout_overhead_time": 34.396268,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 34,
          "loss": 0.05107717216014862,
          "grad_norm": 0.08056640625,
          "learning_rate": 3.4000000000000005e-06,
          "entropy": 0.20190092362463474,
          "cispo_clip_ratio": 0.0029951603792142123,
          "step_time": 159.75958859299863,
          "entropy_control/entropy": 0.20911363313327067,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.136,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 159.665871,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 35,
          "loss": 0.046646419912576675,
          "grad_norm": 0.0556640625,
          "learning_rate": 3.2000000000000003e-06,
          "thinking/tokens_mean": 765.7163265306123,
          "thinking/budget_hit_fraction": 0.14285714285714285,
          "num_tokens": 1056494.0,
          "completions/mean_length": 4875.125,
          "completions/min_length": 3071.0,
          "completions/max_length": 7862.0,
          "completions/clipped_ratio": 0.125,
          "completions/mean_terminated_length": 5132.857421875,
          "completions/min_terminated_length": 3939.0,
          "completions/max_terminated_length": 7862.0,
          "tools/call_frequency": 3.125,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.5713491439819336,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.23723171651363373,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.3541666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.27368009090423584,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.7071067690849304,
          "reward": 0.7390574216842651,
          "reward_std": 0.3830585777759552,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1837924774736166,
          "cispo_clip_ratio": 0.0,
          "step_time": 2039.2121586850008,
          "entropy_control/entropy": 0.2052942728653329,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.14,
          "adapter_sync_time": 0.0,
          "generation_time": 1689.638788,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1748.581729,
          "forward_backward_time": 290.520022,
          "rollout_overhead_time": 58.942942,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 36,
          "loss": 0.046330079436302185,
          "grad_norm": 0.0517578125,
          "learning_rate": 3e-06,
          "entropy": 0.1836686972528696,
          "cispo_clip_ratio": 0.0017699807649478316,
          "step_time": 290.5989363379995,
          "entropy_control/entropy": 0.20518178344367957,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.05,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.144,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 290.498635,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 37,
          "loss": 0.06093544885516167,
          "grad_norm": 0.07763671875,
          "learning_rate": 2.8000000000000003e-06,
          "thinking/tokens_mean": 531.2395833333334,
          "thinking/budget_hit_fraction": 0.13541666666666666,
          "num_tokens": 1156159.0,
          "completions/mean_length": 3332.0625,
          "completions/min_length": 1997.0,
          "completions/max_length": 5808.5,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 3332.0625,
          "completions/min_terminated_length": 1997.0,
          "completions/max_terminated_length": 5808.5,
          "tools/call_frequency": 2.625,
          "tools/failure_frequency": 0.11590909399092197,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/mean": 0.6096699237823486,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__native/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/mean": 0.6666666865348816,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__two_pool_cycle__reliability/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.7289921641349792,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.13682812452316284,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.5625000298023224,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.12789812684059143,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.0,
          "reward": 0.90006023645401,
          "reward_std": 0.10524261742830276,
          "frac_reward_zero_std": 0.5,
          "frac_groups_zero_std": 0.5,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 1.0,
          "n_refills": 1.0,
          "entropy": 0.24642304703593254,
          "cispo_clip_ratio": 0.001176156336441636,
          "step_time": 2265.5598083139994,
          "entropy_control/entropy": 0.24700052264976258,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.05,
          "entropy_control/zeta_next": 0.025,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.148,
          "adapter_sync_time": 0.0,
          "generation_time": 2036.460413,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 2097.484425,
          "forward_backward_time": 167.972686,
          "rollout_overhead_time": 61.024012,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 38,
          "loss": 0.05009032040834427,
          "grad_norm": 0.0830078125,
          "learning_rate": 2.6e-06,
          "entropy": 0.24709582887589931,
          "cispo_clip_ratio": 0.0028627690044231713,
          "step_time": 168.06265335401258,
          "entropy_control/entropy": 0.24758377868775422,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.025,
          "entropy_control/zeta_next": 0.0125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.152,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 167.951618,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 39,
          "loss": 0.006497297435998917,
          "grad_norm": 0.06103515625,
          "learning_rate": 2.4000000000000003e-06,
          "thinking/tokens_mean": 634.1535714285714,
          "thinking/budget_hit_fraction": 0.16071428571428573,
          "num_tokens": 1216950.0,
          "completions/mean_length": 4507.875,
          "completions/min_length": 2730.0,
          "completions/max_length": 5361.0,
          "completions/clipped_ratio": 0.0,
          "completions/mean_terminated_length": 4507.875,
          "completions/min_terminated_length": 2730.0,
          "completions/max_terminated_length": 5361.0,
          "tools/call_frequency": 3.375,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.6413488388061523,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.21211744844913483,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.4375,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.2509901225566864,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": 0.75,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 0.7071067690849304,
          "reward": 0.8132238388061523,
          "reward_std": 0.33593258261680603,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 1.0,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.2179273311048746,
          "cispo_clip_ratio": 0.0,
          "step_time": 1476.0498073280105,
          "entropy_control/entropy": 0.21493800920526132,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.0125,
          "entropy_control/zeta_next": 0.00625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.156,
          "adapter_sync_time": 0.0,
          "generation_time": 1226.948879,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1269.687226,
          "forward_backward_time": 206.248885,
          "rollout_overhead_time": 42.738347,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        },
        {
          "step": 40,
          "loss": 0.00487714447081089,
          "grad_norm": 0.059814453125,
          "learning_rate": 2.2e-06,
          "entropy": 0.21740558557212353,
          "cispo_clip_ratio": 0.0022549554123543203,
          "step_time": 206.3434993449846,
          "entropy_control/entropy": 0.2144068599828818,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.00625,
          "entropy_control/zeta_next": 0.003125,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.16,
          "adapter_sync_time": 0.0,
          "generation_time": 0.0,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 0.0,
          "forward_backward_time": 206.236138,
          "rollout_overhead_time": 0.0,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125,
          "reward": null
        },
        {
          "step": 41,
          "loss": 0.08561861515045166,
          "grad_norm": 0.08251953125,
          "learning_rate": 2.0000000000000003e-06,
          "thinking/tokens_mean": 980.8799999999999,
          "thinking/budget_hit_fraction": 0.27999999999999997,
          "num_tokens": 1280030.0,
          "completions/mean_length": 4408.0,
          "completions/min_length": 3071.0,
          "completions/max_length": 6718.0,
          "completions/clipped_ratio": 0.375,
          "completions/mean_terminated_length": 5210.2001953125,
          "completions/min_terminated_length": 3783.0,
          "completions/max_terminated_length": 6718.0,
          "tools/call_frequency": 2.0,
          "tools/failure_frequency": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/mean": 0.16097012162208557,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__native/std": 0.32194024324417114,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/mean": 0.0833333358168602,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__efficiency/std": 0.1666666716337204,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/mean": -0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__triangular_cycle__reliability/std": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/mean": 0.6074227094650269,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__native/std": 0.013053804636001587,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/mean": 0.5,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__efficiency/std": 0.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/mean": 1.0,
          "rewards/reward_env__skillhub__dex-arbitrage-routing-gym__competing_cycles__reliability/std": 0.0,
          "reward": 0.44877973198890686,
          "reward_std": 0.5373927354812622,
          "frac_reward_zero_std": 0.0,
          "frac_groups_zero_std": 0.0,
          "frac_groups_all_zero": 0.0,
          "frac_groups_all_one": 0.5,
          "n_groups_dropped": 0.0,
          "n_groups_refilled": 0.0,
          "n_refills": 0.0,
          "entropy": 0.1304418332874775,
          "cispo_clip_ratio": 0.0,
          "step_time": 1491.0382166269774,
          "entropy_control/entropy": 0.21580574484545761,
          "entropy_control/target": 0.21118688754598858,
          "entropy_control/target_ready": 1.0,
          "entropy_control/target_samples": 5.0,
          "entropy_control/zeta_used": 0.003125,
          "entropy_control/zeta_next": 0.0015625,
          "entropy_control/epsilon_high_used": 0.2,
          "entropy_control/epsilon_high_next": 0.2,
          "entropy_control/update_skipped": 0.0,
          "entropy_control/importance_weight_cap": 1.2,
          "epoch": 0.164,
          "adapter_sync_time": 0.0,
          "generation_time": 1290.075829,
          "base_reward_time": 0.0,
          "jepa_reward_time": 0.0,
          "rollout_prepare_time": 1325.141617,
          "forward_backward_time": 165.807732,
          "rollout_overhead_time": 35.065787,
          "peak_allocated_gib": 70.26109647750854,
          "peak_reserved_gib": 77.83203125
        }
      ],
      "holdout": []
    }
  ],
  "refill_log_audit": [
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 3,
      "logged_reward": 0.748327225446701,
      "parquet_mean": 0.7221509153023362,
      "delta": -0.026176310144364834,
      "n_refills": 1.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 7,
      "logged_reward": 0.16936538740992546,
      "parquet_mean": 0.04062499962747096,
      "delta": -0.1287403877824545,
      "n_refills": 1.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 9,
      "logged_reward": 0.4399409890174866,
      "parquet_mean": 0.4408177591860294,
      "delta": 0.0008767701685428175,
      "n_refills": 2.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 13,
      "logged_reward": 0.4414585630098979,
      "parquet_mean": 0.4426821870729327,
      "delta": 0.0012236240630348338,
      "n_refills": 2.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 15,
      "logged_reward": 0.42326606810092926,
      "parquet_mean": 0.4236089544370771,
      "delta": 0.0003428863361478185,
      "n_refills": 1.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 21,
      "logged_reward": 0.43824608623981476,
      "parquet_mean": 0.4380193211138248,
      "delta": -0.00022676512598995835,
      "n_refills": 1.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 25,
      "logged_reward": 0.8305423855781555,
      "parquet_mean": 0.8293203920125961,
      "delta": -0.0012219935655594094,
      "n_refills": 2.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 29,
      "logged_reward": 0.44154128432273865,
      "parquet_mean": 0.4409255467355251,
      "delta": -0.0006157375872135606,
      "n_refills": 2.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 31,
      "logged_reward": 1.046946406364441,
      "parquet_mean": 1.046293979883194,
      "delta": -0.0006524264812468594,
      "n_refills": 1.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 33,
      "logged_reward": 0.8970373074213663,
      "parquet_mean": 0.8130628922954202,
      "delta": -0.08397441512594617,
      "n_refills": 2.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 35,
      "logged_reward": 0.18153761327266693,
      "parquet_mean": 0.3456965064629912,
      "delta": 0.16415889319032428,
      "n_refills": 2.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 41,
      "logged_reward": 0.4937981963157654,
      "parquet_mean": 0.5411768492311239,
      "delta": 0.04737865291535848,
      "n_refills": 1.0
    },
    {
      "run_id": "1789165288",
      "method": "dapo-refill",
      "mode": "no-think",
      "step": 43,
      "logged_reward": 0.8437418043613434,
      "parquet_mean": 0.8403472529724241,
      "delta": -0.003394551388919309,
      "n_refills": 1.0
    },
    {
      "run_id": "1789396300",
      "method": "cispo-repo-r-window5-refill",
      "mode": "thinking",
      "step": 37,
      "logged_reward": 0.90006023645401,
      "parquet_mean": 0.8969290001317859,
      "delta": -0.003131236322224118,
      "n_refills": 1.0
    }
  ]
}
