ankit1057

ankit1057/sipllm

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

8 good first / help-wanted issues · C++ · last activity Jul 23, 2026

arm64 cpp cpp17 edge-ai gguf inference llama llama-cpp llm machine-learning neon on-device quantization tinyllama transformer
8 Open Issues Need Help Last updated: Jul 23, 2026

Open Issues Need Help

View All on GitHub
enhancement good first issue architecture
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
enhancement good first issue architecture
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
good first issue
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer
good first issue
ankit1057/sipllm
0

sipllm — a dependency-free streaming GGUF LLM inference engine in C++17. Runs quantized Llama models on-device with flat RAM (it sips weights off disk), Ollama-style CLI, validated layer-by-layer against llama.cpp.

C++
#arm64#cpp#cpp17#edge-ai#gguf#inference#llama#llama-cpp#llm#machine-learning#neon#on-device#quantization#tinyllama#transformer