{
  "dataset": "Salesforce/wikitext",
  "split": "test",
  "tokenSha256": "c7d809472e5fe905d974d502db6690616919b118e7d4e4963421caed411fe136",
  "sequenceLength": 256,
  "rows": [
    {
      "variant": "source-fp32",
      "heldoutPerplexity": 41.77380738449144,
      "heldoutMeanNll": 3.732269525527954,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.0,
      "shortCorpusPerplexity": 73.88481522620674,
      "meanPromptKl": 0.0,
      "top1Equal": 6,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e8-gram2048",
      "heldoutPerplexity": 44.827016151901034,
      "heldoutMeanNll": 3.8028109967708588,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.07054147124290466,
      "weightBytes": 2600908800,
      "shortCorpusPerplexity": 57.4221997418666,
      "meanPromptKl": 0.12230340417590924,
      "top1Equal": 5,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e4-gram8192-emse",
      "heldoutPerplexity": 44.85854227393647,
      "heldoutMeanNll": 3.8035140335559845,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.0712445080280304,
      "weightBytes": 2345711616,
      "shortCorpusPerplexity": 54.87837902628382,
      "meanPromptKl": 0.07179712571329826,
      "top1Equal": 6,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e4-gram8192",
      "heldoutPerplexity": 45.133526756230715,
      "heldoutMeanNll": 3.80962535738945,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.07735583186149597,
      "weightBytes": 2345711616,
      "shortCorpusPerplexity": 53.104639886454585,
      "meanPromptKl": 0.07327184781509762,
      "top1Equal": 6,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e8-gram8192",
      "heldoutPerplexity": 45.23739645294305,
      "heldoutMeanNll": 3.81192409992218,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.07965457439422607,
      "weightBytes": 2600908800,
      "shortCorpusPerplexity": 52.87305268710343,
      "meanPromptKl": 0.06776600381514679,
      "top1Equal": 6,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e8-gram512",
      "heldoutPerplexity": 45.79606777993774,
      "heldoutMeanNll": 3.824198231101036,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.09192870557308197,
      "weightBytes": 2600908800,
      "shortCorpusPerplexity": 55.78982998148945,
      "meanPromptKl": 0.06350787928871189,
      "top1Equal": 6,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e8",
      "heldoutPerplexity": 48.82848757916894,
      "heldoutMeanNll": 3.88831390440464,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.1560443788766861,
      "weightBytes": 2600908800,
      "shortCorpusPerplexity": 53.30346449505347,
      "meanPromptKl": 0.07496181856064747,
      "top1Equal": 6,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g32-e8-mse",
      "heldoutPerplexity": 51.787959542811286,
      "heldoutMeanNll": 3.9471576809883118,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.21488815546035767,
      "weightBytes": 2600908800,
      "shortCorpusPerplexity": 66.69393284799098,
      "meanPromptKl": 0.12776865639413396,
      "top1Equal": 4,
      "promptCount": 6
    },
    {
      "variant": "webgpu-q4g64-e8",
      "heldoutPerplexity": 52.359646307404184,
      "heldoutMeanNll": 3.958136186003685,
      "scoredTokens": 4080,
      "nllExcessOverSource": 0.2258666604757309,
      "weightBytes": 2470606848,
      "shortCorpusPerplexity": 56.921306165209096,
      "meanPromptKl": 0.056566589356710516,
      "top1Equal": 5,
      "promptCount": 6
    }
  ],
  "limitations": [
    "4,080 scored WikiText tokens are a small screening set; repeated candidate selection is not an independent final evaluation.",
    "Gram calibration uses only WikiText train; it does not use test tokens.",
    "Eight-sentence short corpus and six next-token prompt comparisons are diagnostic, not broad task accuracy.",
    "Quantized PyTorch evaluation checks exported weights; browser runtime correctness requires separate parity tests.",
    "Within-group calibration error ignores cross-group covariance and propagated quantization errors."
  ]
}
