Queue Issues

Your job is stuck in the queue? Here’s what to check.

Check Queue Status

# See all jobs in queue
squeue

# See why your job is waiting
squeue --user $USER --output "%.18J %.8P %.8T %.10M %.12L %.20F"

# Check partition status
sinfo --partition

Common Queue Issues

1. Job Pending for Hours

Possible causes:

  • Not enough resources available

  • Lower priority than other jobs

  • Partition is at capacity

What to do:

  • Check if partition has available nodes: sinfo --partition <partition_name>

  • Consider using a different partition

  • Check if you’re hitting fair-share limits

2. Job Repeatedly Requeued

Possible causes:

  • Node failures

  • Maintenance windows

  • Configuration issues

What to do:

  • Check for system announcements

  • Contact support if it persists

  • Try a different partition

3. Low Priority

Check your priority:

sshare --user $USER

Improve priority:

  • Wait (fair-share increases over time)

  • Use lower-priority partitions for testing

  • Request QoS changes if eligible

Tips for Faster Execution

  1. Submit during off-peak hours - Early morning or evening

  2. Use smaller requests - Smaller jobs get scheduled faster

  3. Try different partitions - Some may have less load

  4. Check maintenance schedule - Avoid scheduled downtime