{
  "torch": "2.8.0+cu128",
  "epsilon": 0.2,
  "scope": "fixed log-probability objective and first-gradient comparison; no RL training",
  "cancellation": {
    "1.0": {
      "grpo": {
        "value": 0.85,
        "gradient": [
          0.24999999999999997,
          0.0
        ]
      },
      "gspo": {
        "value": 1.0,
        "gradient": [
          0.5,
          0.5
        ]
      },
      "gspo-token": {
        "value": 1.0,
        "gradient": [
          0.5,
          0.5
        ]
      }
    },
    "-1.0": {
      "grpo": {
        "value": -1.4,
        "gradient": [
          0.0,
          -1.0
        ]
      },
      "gspo": {
        "value": -1.0,
        "gradient": [
          -0.5,
          -0.5
        ]
      },
      "gspo-token": {
        "value": -1.0,
        "gradient": [
          -0.5,
          -0.5
        ]
      }
    }
  },
  "clipping": {
    "s=1.3, A=1.0": {
      "value": 1.2,
      "gradient": [
        0.0,
        0.0
      ]
    },
    "s=0.7, A=1.0": {
      "value": 0.7,
      "gradient": [
        0.35,
        0.35
      ]
    },
    "s=1.3, A=-1.0": {
      "value": -1.3000000000000003,
      "gradient": [
        -0.6500000000000001,
        -0.6500000000000001
      ]
    },
    "s=0.7, A=-1.0": {
      "value": -0.8,
      "gradient": [
        0.0,
        0.0
      ]
    }
  },
  "length_normalization": [
    {
      "length": 2,
      "raw_ratio": 1.0201,
      "gspo_ratio": 1.01
    },
    {
      "length": 100,
      "raw_ratio": 2.7048138294215285,
      "gspo_ratio": 1.01
    },
    {
      "length": 1000,
      "raw_ratio": 20959.155637813845,
      "gspo_ratio": 1.01
    }
  ],
  "is_identity": {
    "target": 0.8,
    "exact": 0.8,
    "root_weight": 0.6324555320336759
  },
  "advantages": [
    [
      -0.9999999800000003,
      0.9999999800000003
    ],
    [
      0.0,
      0.0
    ]
  ]
}
