Kaggle LLM Server — LLM Gratuit sur GPU Kaggle

Problème
Faire tourner un LLM décent nécessite un GPU — et les GPUs coûtent cher. Les alternatives gratuites (Google Colab, Kaggle) imposent des restrictions de temps et de bande passante. De plus, aucun des deux n'expose nativement une API compatible OpenAI, ce qui limite leur utilisation comme backend pour des outils comme LangChain, Cursor, ou des scripts automatisés.
Solution proposée
Ce projet transforme un notebook Kaggle en un serveur LLM gratuit, complet et accessible :
- Qwen 2.5 VL 72B (ou 7B/32B) en quantification Q4 ou Q8 via llama.cpp pour le rendre exécutable sur un seul GPU T4 (16 GB VRAM)
- Une API HTTP compatible OpenAI (
/v1/chat/completions) exposée via un tunnel Cloudflare - Un script Python connecté qui attache le tunnel, lance le serveur et affiche l'URL publique
- Fonctionne aussi depuis Colab, SageMaker, ou tout notebook GPU
Le LLM est multimodal : il peut analyser des images (OCR, diagrammes, photos).
Stack technique
| Composant | Technologie |
|---|---|
| LLM | Qwen 2.5 VL (7B / 32B / 72B) |
| Inference | llama.cpp (quantification Q4/Q8) |
| API | OpenAI-compatible /v1/chat/completions |
| Tunnel | Cloudflare Argo Tunnel (cloudflared) |
| GPU | NVIDIA T4 (Kaggle) ou A100 (optionnel) |
| Langage | Python + Jupyter |
Résultat
Le projet a rencontré un bon accueil sur GitHub (3 étoiles, 4 forks) et a été utilisé par des développeurs cherchant un backend LLM gratuit pour leurs outils. Il démontre une compréhension avancée de l'inférence LLM, de l'optimisation mémoire, et du déploiement sur matériel contraint.