Open Issues Need Help
View All on GitHub help wanted benchmark
Run MoE models bigger than your RAM. A 284B on a 12 GB phone, CPU only, lossless, on stock llama.cpp
C++
#android#cpp#edge-ai#gemma#gguf#gpt-oss#inference#llama-cpp#llm#mixture-of-experts#moe#on-device-ai#qwen