LangChain
Definition
LangChain ist ein beliebtes Open-Source-Framework fuer die Entwicklung von LLM-Anwendungen. Es provides Module fuer Prompt-Management, Chains, Agenten, Memory und RAG-Pipelines. LangChain unterstuetzt alle grossen LLM-Anbieter und Vector Databases.
Beispiel
Mit LangChain kann man in 50 Zeilen Python einen RAG-Chatbot mit PDF-Wissensbasis bauen.
Verwandte Begriffe
Mehr aus “AI/ML”
Model Serving
Model Serving ist der Prozess, ein trainiertes KI-Modell in einer Produktionsumgebung verfuegbar zu machen. Es umfasst API-Endpunkte, Load Balancing, Versionierung und Monitoring. Bekannte Serving-Frameworks sind vLLM, TGI (Text Generation Inference) und TorchServe.
AI Benchmark
AI Benchmarks messen die Leistung von Hardware oder Software bei KI-Workloads. Bekannte Benchmarks sind MLPerf (Training/Inference), AI-Benchmark (Smartphone NPU) und LMSYS Chatbot Arena (LLM-Qualitaet). Sie ermoeglichen objektive Vergleiche zwischen verschiedenen Systemen.
Triton (GPU Programming)
Triton ist eine von OpenAI entwickelte Programmiersprache fuer GPU-Kernel. Sie ermoeglicht Entwicklern, hochperformante GPU-Kernel in Python-Syntax zu schreiben, ohne CUDA-Experten zu sein. Triton wird in PyTorch 2.0 und Flash Attention verwendet.
Speculative Decoding
Speculative Decoding ist eine Inferenz-Optimierungstechnik, bei der ein kleiles Modell schnell Entwuerfe generiert und ein grosses Modell diese verifiziert. Akzeptierte Tokens werden uebernommen, abgelehnte verworfen. Dies kann die Inference-Geschwindigkeit um den Faktor 2-3 erhoehen.