-
Notifications
You must be signed in to change notification settings - Fork 81
OpenJul 26, 2026
Due by August 6, 2026
•Last updated code freeze: July 30th
52% complete
List view
0 of 24 selected 0 issues of 24 selected
[Autoscaling] feat: Throughput Analyzer — proactive rate-based autoscaling
enhancementNew feature or requestNew feature or requestrelease/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1005 In llm-d/llm-d-workload-variant-autoscaler;feat: Promote KEDA+EPP(queue_size,running_request) guide from experimental to stable
enhancementNew feature or requestNew feature or requestrelease/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)Status: Open.#1326 In llm-d/llm-d-workload-variant-autoscaler;[Enhancement]: Overprovisioning buffer for fast scale-up
enhancementNew feature or requestNew feature or requestrelease/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)Status: Open.#1321 In llm-d/llm-d-workload-variant-autoscaler;feat(guides): Provide KEDA configuration for all existing autoscaling guides
enhancementNew feature or requestNew feature or requestrelease/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)Status: Open.#1347 In llm-d/llm-d-workload-variant-autoscaler;feat(rebalancer): Replica Rebalancing
enhancementNew feature or requestNew feature or requestrelease/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)Status: Open.#1348 In llm-d/llm-d-workload-variant-autoscaler;VLLM experiments and metrics analysis for the Throughput Analyzer
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#901 In llm-d/llm-d-workload-variant-autoscaler;Limiter improvements: namespace-scoped inventory, quota-based limiter, and limiter chain
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1000 In llm-d/llm-d-workload-variant-autoscaler;Observability: PrometheusRule Alerting Rules
needs-triageIndicates an issue or PR lacks a triage label and requires one.Indicates an issue or PR lacks a triage label and requires one.Status: Open.#919 In llm-d/llm-d-workload-variant-autoscaler;fix(collector/analyzer): distinguish unavailable metric values from genuine zeros in ReplicaMetrics
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1264 In llm-d/llm-d-workload-variant-autoscaler;analyzer: extended result type — accept-for-SC/RC/all flags + sanity helper mechanism
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1261 In llm-d/llm-d-workload-variant-autoscaler;cost_aware_optimizer: greedy efficiency-first allocation overpays when cheaper variant covers overflow at lower absolute cost
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1251 In llm-d/llm-d-workload-variant-autoscaler;- Status: Open (in progress).llm-d/llm-d-workload-variant-autoscalernumber 1353#1353 In llm-d/llm-d-workload-variant-autoscaler;
- Status: Open.#1361 In llm-d/llm-d-workload-variant-autoscaler;
KEDA only config that works with epp inferencepool saturation metrics
enhancementNew feature or requestNew feature or requestrelease/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1219 In llm-d/llm-d-workload-variant-autoscaler;Feat: Latency predictor based autoscaling using KEDA
enhancementNew feature or requestNew feature or requestneeds-triageIndicates an issue or PR lacks a triage label and requires one.Indicates an issue or PR lacks a triage label and requires one.Status: Open.#1408 In llm-d/llm-d-workload-variant-autoscaler;Add guide for latency predictor based autoscaling
EPPIssue related to EPP integration.Issue related to EPP integration.Status: Open.#1409 In llm-d/llm-d-workload-variant-autoscaler;Add benchmarking report for latency predictor based autoscaling
EPPIssue related to EPP integration.Issue related to EPP integration.Status: Open.#1410 In llm-d/llm-d-workload-variant-autoscaler;Add benchmarking for token-based capacity feature in WVA
enhancementNew feature or requestNew feature or requestneeds-triageIndicates an issue or PR lacks a triage label and requires one.Indicates an issue or PR lacks a triage label and requires one.Status: Open.#1411 In llm-d/llm-d-workload-variant-autoscaler;Run benchmark with EPP+KEDA path with optimized baseline plugins and flowcontrol
release/v0.9Tracked issue for v0.9 release (Aug 2026)Tracked issue for v0.9 release (Aug 2026)Status: Open.#1421 In llm-d/llm-d-workload-variant-autoscaler;- Status: Open (in progress).llm-d/llm-d-workload-variant-autoscalernumber 1448#1448 In llm-d/llm-d-workload-variant-autoscaler;
- Status: Open (in progress).llm-d/llm-d-workload-variant-autoscalernumber 1450#1450 In llm-d/llm-d-workload-variant-autoscaler;
Architectural cleanup: remove dead Inferno-solver code, collapse pkg/, clarify naming
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1402 In llm-d/llm-d-workload-variant-autoscaler;Saturation V2: per-replica demand ignores output tokens for waiting requests on decode/"both" replicas
bugSomething isn't workingSomething isn't workingtriage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1456 In llm-d/llm-d-workload-variant-autoscaler;fix(coordinator): Use optimistic locking for HPA patches to prevent silent overwrites
triage/acceptedIndicates an issue or PR is ready to be actively worked on.Indicates an issue or PR is ready to be actively worked on.Status: Open.#1425 In llm-d/llm-d-workload-variant-autoscaler;