Phi-2 (2.7B) - CPU-Optimized Streaming Code Generator

CPU optimizations enabled:

  • Dynamic INT8 quantization (~2x faster)
  • KV cache enabled
  • Low memory usage mode
  • Optimized generation parameters

For even better CPU performance, consider:

  • Using a smaller model (Phi-1.5, TinyLlama)
  • ONNX Runtime conversion
  • Intel OpenVINO toolkit

Running on: CPU (Quantized)

1 500
0.1 1.5

CPU Speed Tips:

  • Fastest: Disable sampling, use 20-30 tokens
  • Balanced: Disable sampling, use 30-50 tokens
  • For better speed: Consider switching to Phi-1.5 (1.3B) or TinyLlama (1.1B)

Current optimizations:

  • ✓ INT8 dynamic quantization (~2x speedup)
  • ✓ KV caching enabled
  • ✓ Greedy decoding by default