Borrelle.
  • Accueil
  • Projets
  • Blog
  • Services
  • À propos
  • Contact
|
Borrelle

Studio d'ingénierie IA — agents conversationnels, applications web & mobiles, systèmes intelligents.

Confidentialité

© 2026 Borrelle

Fondé par Tahsine Kajola SALAMI

Tous les projets
mai 2026Livré

Kaggle LLM Server — LLM Gratuit sur GPU Kaggle

KaggleLLMGPUllama.cppPythonOpenAICloudflare
Code source
Kaggle LLM Server — LLM Gratuit sur GPU Kaggle

Problème

Faire tourner un LLM décent nécessite un GPU — et les GPUs coûtent cher. Les alternatives gratuites (Google Colab, Kaggle) imposent des restrictions de temps et de bande passante. De plus, aucun des deux n'expose nativement une API compatible OpenAI, ce qui limite leur utilisation comme backend pour des outils comme LangChain, Cursor, ou des scripts automatisés.

Solution proposée

Ce projet transforme un notebook Kaggle en un serveur LLM gratuit, complet et accessible :

  • Qwen 2.5 VL 72B (ou 7B/32B) en quantification Q4 ou Q8 via llama.cpp pour le rendre exécutable sur un seul GPU T4 (16 GB VRAM)
  • Une API HTTP compatible OpenAI (/v1/chat/completions) exposée via un tunnel Cloudflare
  • Un script Python connecté qui attache le tunnel, lance le serveur et affiche l'URL publique
  • Fonctionne aussi depuis Colab, SageMaker, ou tout notebook GPU

Le LLM est multimodal : il peut analyser des images (OCR, diagrammes, photos).

Stack technique

ComposantTechnologie
LLMQwen 2.5 VL (7B / 32B / 72B)
Inferencellama.cpp (quantification Q4/Q8)
APIOpenAI-compatible /v1/chat/completions
TunnelCloudflare Argo Tunnel (cloudflared)
GPUNVIDIA T4 (Kaggle) ou A100 (optionnel)
LangagePython + Jupyter

Résultat

Le projet a rencontré un bon accueil sur GitHub (3 étoiles, 4 forks) et a été utilisé par des développeurs cherchant un backend LLM gratuit pour leurs outils. Il démontre une compréhension avancée de l'inférence LLM, de l'optimisation mémoire, et du déploiement sur matériel contraint.

← Retour aux projets