Run MoE models bigger than your RAM. A 284B on a 12 GB phone, CPU only, lossless, on stock llama.cpp

android cpp edge-ai gemma gguf gpt-oss inference llama-cpp llm mixture-of-experts moe on-device-ai qwen
1 Open Issue Need Help Last updated: Aug 27, 2026

Open Issues Need Help

View All on GitHub

Run MoE models bigger than your RAM. A 284B on a 12 GB phone, CPU only, lossless, on stock llama.cpp

C++
#android#cpp#edge-ai#gemma#gguf#gpt-oss#inference#llama-cpp#llm#mixture-of-experts#moe#on-device-ai#qwen