{
  "host": {
    "gpu": "NVIDIA GeForce RTX 3080",
    "vram_total_mb": "10240",
    "driver": "595.84",
    "ollama_version": "ollama version is 0.32.9",
    "platform": "Linux-6.8.0-137-generic-x86_64-with-glibc2.39",
    "measured_at": "2026-08-18T15:52:03.069989+00:00"
  },
  "model": "qwen3.5:9b-q4_K_M",
  "prompt": "Explain in three sentences why memory bandwidth, rather than raw FLOPs, usually limits transformer inference on consumer GPUs.",
  "other_processes_at_start": {
    "/home/tomo/ComfyUI/.venv/bin/python": 398
  },
  "measured_at": "2026-08-18T15:53:55.861190+00:00",
  "steps": [
    {
      "ballast_requested_mb": 0,
      "ballast_granted_mb": 0,
      "vram_in_use_before_load_mb": 443,
      "vram_free_before_load_mb": 9797,
      "loaded": true,
      "total_seconds": 4.63,
      "load_seconds": 3.58,
      "tokens_generated": 96,
      "tokens_per_second": 98.34,
      "ollama_vram_mb": 7436,
      "processor_split": "100% GPU",
      "ballast_survived": true
    },
    {
      "ballast_requested_mb": 1024,
      "ballast_granted_mb": 1024,
      "vram_in_use_before_load_mb": 1725,
      "vram_free_before_load_mb": 8515,
      "loaded": true,
      "total_seconds": 4.6,
      "load_seconds": 3.55,
      "tokens_generated": 96,
      "tokens_per_second": 98.55,
      "ollama_vram_mb": 7436,
      "processor_split": "100% GPU",
      "ballast_survived": true
    },
    {
      "ballast_requested_mb": 2048,
      "ballast_granted_mb": 2048,
      "vram_in_use_before_load_mb": 2749,
      "vram_free_before_load_mb": 7491,
      "loaded": true,
      "total_seconds": 10.14,
      "load_seconds": 5.41,
      "tokens_generated": 96,
      "tokens_per_second": 21.58,
      "ollama_vram_mb": 6290,
      "processor_split": "27%/73% CPU/GPU",
      "ballast_survived": true
    },
    {
      "ballast_requested_mb": 3072,
      "ballast_granted_mb": 3072,
      "vram_in_use_before_load_mb": 3773,
      "vram_free_before_load_mb": 6467,
      "loaded": true,
      "total_seconds": 13.89,
      "load_seconds": 6.01,
      "tokens_generated": 96,
      "tokens_per_second": 13.0,
      "ollama_vram_mb": 5310,
      "processor_split": "42%/58% CPU/GPU",
      "ballast_survived": true
    },
    {
      "ballast_requested_mb": 4096,
      "ballast_granted_mb": 4096,
      "vram_in_use_before_load_mb": 4797,
      "vram_free_before_load_mb": 5443,
      "loaded": true,
      "total_seconds": 16.85,
      "load_seconds": 6.37,
      "tokens_generated": 96,
      "tokens_per_second": 9.76,
      "ollama_vram_mb": 4322,
      "processor_split": "56%/44% CPU/GPU",
      "ballast_survived": true
    },
    {
      "ballast_requested_mb": 5120,
      "ballast_granted_mb": 5120,
      "vram_in_use_before_load_mb": 5821,
      "vram_free_before_load_mb": 4419,
      "loaded": true,
      "total_seconds": 19.77,
      "load_seconds": 6.19,
      "tokens_generated": 96,
      "tokens_per_second": 7.56,
      "ollama_vram_mb": 3202,
      "processor_split": "72%/28% CPU/GPU",
      "ballast_survived": true
    }
  ]
}