TECHNOLOGY GRAPH
AI प्रौद्योगिकी
मॉडल की संरचना और प्रशिक्षण से लेकर अनुमान, तैनाती और खुले भार वाले मॉडलों के उदाहरणों तक
उन तकनीकी परतों का चुना हुआ मानचित्र जो शोध के विचारों को प्रशिक्षित किए जा सकने वाले मॉडलों और काम में लाए जा सकने वाली प्रणालियों में बदलती हैं। हर प्रविष्टि किसी संकल्पना को शोधपत्रों, ऐतिहासिक युगों, मॉडल के उदाहरणों, उपकरणों और प्राथमिक स्रोतों से जोड़ती है।
मॉडल संरचना
वे संरचनाएँ जो तय करती हैं कि मॉडल सूचना को कैसे निरूपित और रूपांतरित करते हैं।
Transformer
अवधान पर आधारित एक तंत्रिका संरचना जो अनुक्रम की स्थितियों को समानांतर रूप से संसाधित करती है। यह अनेक आधुनिक भाषा और बहुविध मॉडलों का आधार बनी।
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
मार्गनिर्देशित विशेषज्ञ संरचनाओं का एक कुल। आधुनिक विरल रूप हर निवेश के लिए केवल चुने हुए विशेषज्ञ उपजालों को सक्रिय करते हैं, जिससे क्षमता बढ़ती है पर हर टोकन पर हर प्राचल सक्रिय नहीं होता।
- experts
- router
- sparse activation
Diffusion Model
एक जनक मॉडल जो क्रमिक रूप से शोर मिलाने की प्रक्रिया को उलटना सीखता है। बार-बार शोर हटाना छवि, ध्वनि, वीडियो और बहुविध सृजन का एक प्रमुख रास्ता बना।
- forward noise
- denoising
- score matching
ढाँचे और निरूपण
मॉडल बनाने, प्रशिक्षित करने और चलाने में काम आने वाले सॉफ़्टवेयर तथा डेटा अंतरापृष्ठ।
PyTorch
स्वचालित अवकलन, तंत्रिका-जाल मॉड्यूल, संकलन और वितरित निष्पादन वाला एक मुक्त-स्रोत टेंसर तथा गहन-अधिगम ढाँचा। शोध के प्रारूपों से लेकर उत्पादन-स्तर के प्रशिक्षण तक इसका व्यापक उपयोग है।
- tensor
- autograd
- module
Hugging Face Transformers
एक मॉडल-परिभाषा पुस्तकालय जो पूर्वप्रशिक्षित संरचनाओं को प्रशिक्षण और अनुमान की व्यवस्थाओं से जोड़ता है। यह विन्यास, पूर्वसंस्करण, लदान, सृजन और अनेक कार्य-अंतरापृष्ठों को मानकीकृत करता है।
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
कच्चे पाठ और मॉडल द्वारा संसाधित विविक्त इकाइयों के बीच का प्रतिचित्रण। शब्दकोश का निर्माण और विखंडन अनुक्रम की लम्बाई, बहुभाषी कवरेज, लागत और मॉडल के व्यवहार को प्रभावित करते हैं।
- token
- vocabulary
- BPE
प्रशिक्षण और उत्तर-प्रशिक्षण
मापन, अनुकूलन और अभिरुचि की वे विधियाँ जो मॉडल की क्षमता और व्यवहार गढ़ती हैं।
Distributed Training
वे तकनीकें जो डेटा, प्राचल, सक्रियण या संगणना को अनेक युक्तियों और नोडों में बाँटती हैं। ये बड़े मॉडलों का प्रशिक्षण संभव बनाती हैं, पर संचार, तुल्यकालन और दोष-सहिष्णुता के समझौते भी लाती हैं।
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
उत्तर-प्रशिक्षण विधियों का एक कुल जो निर्देश-पालन और अभिरुचि के अनुरूप व्यवहार सिखाता है। SFT प्रदर्शनों से सीखता है; RLHF और DPO अभिरुचि की तुलनाओं का उपयोग भिन्न अनुकूलन प्रक्रियाओं से करते हैं।
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
वह उत्तर-प्रशिक्षण जो मॉडल को उत्तर देने से पहले लम्बा तर्क-सूत्र रचना सिखाता है, और कठिन प्रश्न पर अनुमान के समय अधिक संगणना खर्च करना सिखाता है। सत्यापन-योग्य पुरस्कारों वाला पुनर्बलन अधिगम — जहाँ जाँचा जा सकने वाला उत्तर ही प्रशिक्षण-संकेत देता है — वही है जिसने इस रास्ते को बंद प्रयोगशालाओं के बाहर दोहराने योग्य बनाया। समझौता साफ़ कहने लायक है: शुद्धता बड़े मॉडल से नहीं, लम्बे सृजन से ख़रीदी जाती है, और उसकी क़ीमत विलम्ब तथा परोसने की लागत में चुकाई जाती है।
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
प्राचल-मितव्ययी सूक्ष्म-अनुकूलन की विधियाँ जो आधार भार जमे रहने देती हैं और छोटे निम्न-कोटि अनुकूलक प्रशिक्षित करती हैं। QLoRA इन अनुकूलकों को क्वांटीकृत आधार मॉडल के साथ जोड़कर स्मृति की खपत और घटाता है।
- low-rank adapters
- frozen base model
- 4-bit training
अनुमान और तैनाती
मॉडल परोसने में काम आने वाली स्मृति, अनुसूचन, संपीड़न और रनटाइम तकनीकें।
Quantization
भार, सक्रियण या तमोगत संचय को कम संख्यात्मक परिशुद्धता में निरूपित करना। इससे स्मृति, बैंडविड्थ और संगणना की लागत घट सकती है, पर शुद्धता और हार्डवेयर-समर्थन के समझौते रहते हैं।
- precision
- INT8
- INT4
KV Cache
स्वप्रतिगामी सृजन के दौरान पहले आए टोकनों की अवधान कुंजियों और मानों का संचय। यह पूरे उपसर्ग की पुनर्गणना बचाता है, पर अक्सर स्मृति का बड़ा उपभोक्ता बन जाता है।
- keys
- values
- prefill
Continuous Batching / PagedAttention
परोसने की वे तकनीकें जो अनुरोधों को लगातार लेती-छोड़ती रहती हैं और KV-संचय की स्मृति को पन्नों में सँभालती हैं। मिलकर ये परिवर्ती लम्बाई वाले भार में उपयोग और निर्गम दोनों बढ़ाती हैं।
- request scheduling
- memory paging
- throughput
Speculative Decoding
एक अनुमान-विधि जिसमें तेज़ प्रारूप कई टोकन प्रस्तावित करता है और लक्ष्य मॉडल उन्हें समानांतर रूप से सत्यापित करता है। यह लक्ष्य-वितरण बदले बिना सृजन का विलम्ब घटा सकती है।
- draft model
- verification
- latency
Open-model Inference Ecosystem
vLLM और llama.cpp जैसे इंजन और रनटाइम डाउनलोड किए जा सकने वाले मॉडल भारों को स्थानीय या सर्वर अनुमान में बदल देते हैं। निर्गम, हार्डवेयर पोर्टेबिलिटी, मॉडल प्रारूप और संचालन की जटिलता के मामले में इनकी प्राथमिकताएँ अलग-अलग हैं।
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
अनुप्रयोग संरचना
मॉडल कार्यप्रवाह, उपकरणों, संदर्भ के आदान-प्रदान, सुरक्षा घेरों और मूल्यांकन के ज़रिए उत्पाद बनते हैं। MCP और उपकरण खंड इस अनुप्रयोग परत को पहले से ही समेटते हैं, इसलिए यहाँ उसे दोहराया नहीं गया।
खुले मॉडल के उदाहरण
कोड, भार, प्रशिक्षण के खुलेपन और अनुज्ञप्ति के आधार पर जाँचे गए मॉडल कुल।
Llama
Meta का डाउनलोड-योग्य भार वाला मॉडल कुल स्थानीय अनुमान और आगे के सूक्ष्म-अनुकूलन के विस्तार में सहायक रहा। इसकी रिलीज़ें Llama की अपनी शर्तों पर आती हैं, इसलिए OSI-परिभाषित मुक्त स्रोत मान लेने के बजाय “खुले भार” कहना अधिक सटीक है।
- open weights
- community license
- model family
Qwen
Alibaba का Qwen कुल सघन, विशेषज्ञ-मार्गनिर्देशित, बहुभाषी और बहुविध रिलीज़ों में फैला है। अनेक चेकपॉइंट खुले रूप से डाउनलोड किए जा सकते हैं, पर अनुज्ञप्ति और प्रकटीकरण के दावे हर मॉडल कार्ड के स्तर पर जाँचने चाहिए।
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Mistral AI के कुल में सघन Mistral मॉडल और विशेषज्ञ-मार्गनिर्देशित Mixtral मॉडल दोनों हैं। कुछ रिलीज़ें उदार अनुज्ञप्तियों पर हैं और कुछ नहीं, इसलिए खुलेपन का आकलन हर कलाकृति के स्तर पर करना होगा।
- dense models
- MoE
- open weights
DeepSeek
DeepSeek की डाउनलोड-योग्य रिलीज़ों ने MoE रचना, तर्कण का उत्तर-प्रशिक्षण और मितव्ययी परोसन को व्यापक अध्ययन का विषय बनाया। कोड और भार की अनुज्ञप्तियाँ भिन्न हो सकती हैं, और प्रशिक्षण-डेटा का प्रकटीकरण एक अलग आयाम है।
- MoE
- reasoning
- open weights
Gemma
Google का डाउनलोड-योग्य भार वाला कुल Gemini से निकले शोध को स्थानीय, किनारे और होस्ट की गई तैनाती से जोड़ता है। Google इस कुल को खुले मॉडल कहता है, जबकि उपयोग Gemma की अपनी शर्तों से शासित रहता है।
- open weights
- lightweight models
- edge deployment
OLMo
Ai2, OLMo कुल को उसके पूर्वप्रशिक्षण डेटा, प्रशिक्षण कोड, मध्यवर्ती चेकपॉइंट और लॉग के साथ भारों सहित जारी करता है। पहला OLMo फ़रवरी 2024 में आया, OLMo 2 उसी वर्ष नवम्बर में, और Olmo 3 नवम्बर 2025 में — Apache 2.0 के अंतर्गत 7B तथा 32B के Base, Instruct और Think रूपों के साथ। यही वह उदाहरण है जहाँ अलग-अलग जाँचने लायक चारों चीज़ें — कोड, भार, प्रशिक्षण का प्रकटीकरण और अनुज्ञप्ति — सचमुच प्रकाशित हैं, जिससे यह उन कुलों के सामने एक कसौटी बन जाता है जो केवल भार जारी करते हैं।
- fully open
- open training data
- intermediate checkpoints
gpt-oss
OpenAI के gpt-oss-120b और 20b डाउनलोड-योग्य MoE तर्कण मॉडल हैं, जो स्थानीय और होस्ट किए गए अनुमान के लिए बने हैं। इनके Apache 2.0 भार और संदर्भ कार्यान्वयन तैनाती की पहुँच बढ़ाते हैं, जबकि पूर्वप्रशिक्षण का डेटासेट स्वयं जारी नहीं किया गया।
- open weights
- reasoning
- MoE
GLM-5
Z.ai की GLM-5 शृंखला तर्कण, कोडिंग और लम्बी अवधि के एजेंट-कार्य के लिए बना एक बड़ा MoE भाषा-मॉडल कुल है। GLM-5 फ़रवरी 2026 में आया, 5.1 अप्रैल में, 5.2 जून में 753 अरब प्राचल और दस लाख टोकन की संदर्भ खिड़की के साथ, और 5.3 अगस्त में उसी आधार पर उत्तर-प्रशिक्षण के बदलावों के साथ; छोटा GLM-5.3-Flash कुछ ही दिन बाद कुल 320 अरब और 18 अरब सक्रिय प्राचल के साथ आया। बड़े सदस्यों का आकार स्वयं होस्ट करना संसाधन-गहन बना देता है।
- open weights
- MoE
- long context
Kimi K3
Moonshot AI ने जुलाई 2026 में Kimi K3 को खुले भार वाले, मूलतः बहुविध MoE भाषा-मॉडल के रूप में जारी किया — कुल 2.8 खरब प्राचल, 104 अरब सक्रिय प्राचल और दस लाख टोकन की संदर्भ खिड़की के साथ। यह लम्बी अवधि की कोडिंग, ज्ञान-कार्य और उपकरण चलाने वाले एजेंटों को लक्ष्य करता है, जबकि इसका आकार स्थानीय तैनाती को कठिन बना देता है।
- open weights
- MoE
- long context
यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।