{
  "schema": "stable-upstream-multi-replica-benchmark-v1",
  "date": "2026-08-10",
  "topology": {
    "endpoint_picker_replicas": 1,
    "model_replicas_tested": [
      1,
      2,
      4
    ],
    "gpus_per_model_replica": 1
  },
  "hardware": {
    "gpu_per_model_replica": "NVIDIA H100"
  },
  "model_service": {
    "model": "GPT-OSS 20B",
    "runtime": "Red Hat AI Inference Server vLLM",
    "tensor_parallel_size": 1,
    "max_model_len": 32768,
    "max_num_batched_tokens": 8192,
    "max_num_seqs": 128,
    "gpu_memory_utilization": 0.9,
    "prefix_cache": "disabled"
  },
  "endpoint_picker": {
    "version": "llm-d Endpoint Picker v0.9.0",
    "flow_control_gate": "enabled",
    "detector": "token-concurrency",
    "max_token_concurrency": 20000,
    "estimated_output_tokens_included": false,
    "headroom": 0.25,
    "picker": "random",
    "priority_bands": [
      100,
      50,
      0,
      -10
    ],
    "fairness": "round-robin within each priority band"
  },
  "traffic": {
    "scenario_file": "scenario.json",
    "description": "Cache-off long-context interference with offered load scaled per model replica.",
    "scenario_names": [
      "one_replica_scaled_load",
      "two_replica_scaled_load",
      "four_replica_scaled_load"
    ]
  },
  "execution": {
    "arrival": "open-loop Poisson replay with noisy sinusoidal phases",
    "seed": 18,
    "production_repeats_per_topology": 3,
    "matched_offered_load_per_gpu": true,
    "load_generator": "GuideLLM",
    "worker_processes_per_tenant_per_gpu": 8,
    "worker_poll_interval_seconds": 0.01
  },
  "decision_limits": {
    "offered_load_difference_per_gpu_percent": 1,
    "maximum_served_rps_per_gpu_regression_percent": 15,
    "maximum_premium_burst_p95_ttft_regression_percent": 20,
    "required_non_200_responses": 0,
    "required_endpoint_picker_restarts": 0
  },
  "runner": {
    "scenario_source": "pipeline/benchmark.py",
    "sha256": "3811ec26c46bf3a26fa643698ec54bf569bb4bc99c3ea22ca18f805cb077b8e0",
    "traffic_driver": "GuideLLM",
    "guidellm_version": "0.7.0",
    "trace_compiler": "pipeline/guidellm_trace.py",
    "launcher": "pipeline/run_guidellm_scenario.py",
    "scenario_file": "scenario.json"
  }
}
