ganloss
Jobs
Training
Companies
Events
Guides
Jobs
Talent
Training
Companies
Guides
Sign in
Sign in
Remote
AI Dev SF
Full-time
Internship
AI PO
Freelance
All tests
LLM & GenAI
Coût et latence LLM
Optimiser un chatbot à 10 000 requêtes/jour sous contrainte P95.
0:00
Chatbot production : 10 k req/jour, budget P95 < 2 s. Quel levier apporte le meilleur ratio coût/latence ?
Utiliser le plus grand modèle disponible pour chaque requête
Router requêtes simples vers petit modèle, cache des FAQ fréquentes, embeddings batch offline
Supprimer le reranker sur toutes les requêtes RAG
Fixer max_tokens à 4096 pour des réponses plus complètes
Explain your choices
(optional, recommended)
Submit for grading