हिन्दी
← मुखपृष्ठ पर लौटें

मॉडल संरचना

वे संरचनाएँ जो तय करती हैं कि मॉडल सूचना को कैसे निरूपित और रूपांतरित करते हैं।

3 प्रविष्टियाँ

ढाँचे और निरूपण

मॉडल बनाने, प्रशिक्षित करने और चलाने में काम आने वाले सॉफ़्टवेयर तथा डेटा अंतरापृष्ठ।

3 प्रविष्टियाँ
2016–2017

PyTorch

स्वचालित अवकलन, तंत्रिका-जाल मॉड्यूल, संकलन और वितरित निष्पादन वाला एक मुक्त-स्रोत टेंसर तथा गहन-अधिगम ढाँचा। शोध के प्रारूपों से लेकर उत्पादन-स्तर के प्रशिक्षण तक इसका व्यापक उपयोग है।

  • tensor
  • autograd
  • module
2018–2019

Hugging Face Transformers

एक मॉडल-परिभाषा पुस्तकालय जो पूर्वप्रशिक्षित संरचनाओं को प्रशिक्षण और अनुमान की व्यवस्थाओं से जोड़ता है। यह विन्यास, पूर्वसंस्करण, लदान, सृजन और अनेक कार्य-अंतरापृष्ठों को मानकीकृत करता है।

  • model definitions
  • pretrained checkpoints
  • Trainer
2015 / 2018

Tokenization

कच्चे पाठ और मॉडल द्वारा संसाधित विविक्त इकाइयों के बीच का प्रतिचित्रण। शब्दकोश का निर्माण और विखंडन अनुक्रम की लम्बाई, बहुभाषी कवरेज, लागत और मॉडल के व्यवहार को प्रभावित करते हैं।

  • token
  • vocabulary
  • BPE

प्रशिक्षण और उत्तर-प्रशिक्षण

मापन, अनुकूलन और अभिरुचि की वे विधियाँ जो मॉडल की क्षमता और व्यवहार गढ़ती हैं।

4 प्रविष्टियाँ
2012–present

Distributed Training

वे तकनीकें जो डेटा, प्राचल, सक्रियण या संगणना को अनेक युक्तियों और नोडों में बाँटती हैं। ये बड़े मॉडलों का प्रशिक्षण संभव बनाती हैं, पर संचार, तुल्यकालन और दोष-सहिष्णुता के समझौते भी लाती हैं।

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
2017 / 2022 / 2023

SFT / RLHF / DPO

उत्तर-प्रशिक्षण विधियों का एक कुल जो निर्देश-पालन और अभिरुचि के अनुरूप व्यवहार सिखाता है। SFT प्रदर्शनों से सीखता है; RLHF और DPO अभिरुचि की तुलनाओं का उपयोग भिन्न अनुकूलन प्रक्रियाओं से करते हैं।

  • supervised fine-tuning
  • preference data
  • reward model
2024 / 2025

Reasoning and test-time compute

वह उत्तर-प्रशिक्षण जो मॉडल को उत्तर देने से पहले लम्बा तर्क-सूत्र रचना सिखाता है, और कठिन प्रश्न पर अनुमान के समय अधिक संगणना खर्च करना सिखाता है। सत्यापन-योग्य पुरस्कारों वाला पुनर्बलन अधिगम — जहाँ जाँचा जा सकने वाला उत्तर ही प्रशिक्षण-संकेत देता है — वही है जिसने इस रास्ते को बंद प्रयोगशालाओं के बाहर दोहराने योग्य बनाया। समझौता साफ़ कहने लायक है: शुद्धता बड़े मॉडल से नहीं, लम्बे सृजन से ख़रीदी जाती है, और उसकी क़ीमत विलम्ब तथा परोसने की लागत में चुकाई जाती है।

  • reasoning traces
  • verifiable rewards
  • inference budget
2021 / 2023

LoRA / QLoRA

प्राचल-मितव्ययी सूक्ष्म-अनुकूलन की विधियाँ जो आधार भार जमे रहने देती हैं और छोटे निम्न-कोटि अनुकूलक प्रशिक्षित करती हैं। QLoRA इन अनुकूलकों को क्वांटीकृत आधार मॉडल के साथ जोड़कर स्मृति की खपत और घटाता है।

  • low-rank adapters
  • frozen base model
  • 4-bit training

अनुमान और तैनाती

मॉडल परोसने में काम आने वाली स्मृति, अनुसूचन, संपीड़न और रनटाइम तकनीकें।

5 प्रविष्टियाँ
2015 / LLM PTQ 2022

Quantization

भार, सक्रियण या तमोगत संचय को कम संख्यात्मक परिशुद्धता में निरूपित करना। इससे स्मृति, बैंडविड्थ और संगणना की लागत घट सकती है, पर शुद्धता और हार्डवेयर-समर्थन के समझौते रहते हैं।

  • precision
  • INT8
  • INT4
2017–present

KV Cache

स्वप्रतिगामी सृजन के दौरान पहले आए टोकनों की अवधान कुंजियों और मानों का संचय। यह पूरे उपसर्ग की पुनर्गणना बचाता है, पर अक्सर स्मृति का बड़ा उपभोक्ता बन जाता है।

  • keys
  • values
  • prefill
2022–2023

Continuous Batching / PagedAttention

परोसने की वे तकनीकें जो अनुरोधों को लगातार लेती-छोड़ती रहती हैं और KV-संचय की स्मृति को पन्नों में सँभालती हैं। मिलकर ये परिवर्ती लम्बाई वाले भार में उपयोग और निर्गम दोनों बढ़ाती हैं।

  • request scheduling
  • memory paging
  • throughput
2022

Speculative Decoding

एक अनुमान-विधि जिसमें तेज़ प्रारूप कई टोकन प्रस्तावित करता है और लक्ष्य मॉडल उन्हें समानांतर रूप से सत्यापित करता है। यह लक्ष्य-वितरण बदले बिना सृजन का विलम्ब घटा सकती है।

  • draft model
  • verification
  • latency
2023–present

Open-model Inference Ecosystem

vLLM और llama.cpp जैसे इंजन और रनटाइम डाउनलोड किए जा सकने वाले मॉडल भारों को स्थानीय या सर्वर अनुमान में बदल देते हैं। निर्गम, हार्डवेयर पोर्टेबिलिटी, मॉडल प्रारूप और संचालन की जटिलता के मामले में इनकी प्राथमिकताएँ अलग-अलग हैं।

  • vLLM
  • llama.cpp
  • GGUF

APPLICATION LAYER

अनुप्रयोग संरचना

मॉडल कार्यप्रवाह, उपकरणों, संदर्भ के आदान-प्रदान, सुरक्षा घेरों और मूल्यांकन के ज़रिए उत्पाद बनते हैं। MCP और उपकरण खंड इस अनुप्रयोग परत को पहले से ही समेटते हैं, इसलिए यहाँ उसे दोहराया नहीं गया।

खुले मॉडल के उदाहरण

कोड, भार, प्रशिक्षण के खुलेपन और अनुज्ञप्ति के आधार पर जाँचे गए मॉडल कुल।

9 प्रविष्टियाँ
2023

Llama

Meta का डाउनलोड-योग्य भार वाला मॉडल कुल स्थानीय अनुमान और आगे के सूक्ष्म-अनुकूलन के विस्तार में सहायक रहा। इसकी रिलीज़ें Llama की अपनी शर्तों पर आती हैं, इसलिए OSI-परिभाषित मुक्त स्रोत मान लेने के बजाय खुले भार कहना अधिक सटीक है।

  • open weights
  • community license
  • model family
2023

Qwen

Alibaba का Qwen कुल सघन, विशेषज्ञ-मार्गनिर्देशित, बहुभाषी और बहुविध रिलीज़ों में फैला है। अनेक चेकपॉइंट खुले रूप से डाउनलोड किए जा सकते हैं, पर अनुज्ञप्ति और प्रकटीकरण के दावे हर मॉडल कार्ड के स्तर पर जाँचने चाहिए।

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

Mistral AI के कुल में सघन Mistral मॉडल और विशेषज्ञ-मार्गनिर्देशित Mixtral मॉडल दोनों हैं। कुछ रिलीज़ें उदार अनुज्ञप्तियों पर हैं और कुछ नहीं, इसलिए खुलेपन का आकलन हर कलाकृति के स्तर पर करना होगा।

  • dense models
  • MoE
  • open weights
2023

DeepSeek

DeepSeek की डाउनलोड-योग्य रिलीज़ों ने MoE रचना, तर्कण का उत्तर-प्रशिक्षण और मितव्ययी परोसन को व्यापक अध्ययन का विषय बनाया। कोड और भार की अनुज्ञप्तियाँ भिन्न हो सकती हैं, और प्रशिक्षण-डेटा का प्रकटीकरण एक अलग आयाम है।

  • MoE
  • reasoning
  • open weights
2024

Gemma

Google का डाउनलोड-योग्य भार वाला कुल Gemini से निकले शोध को स्थानीय, किनारे और होस्ट की गई तैनाती से जोड़ता है। Google इस कुल को खुले मॉडल कहता है, जबकि उपयोग Gemma की अपनी शर्तों से शासित रहता है।

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2, OLMo कुल को उसके पूर्वप्रशिक्षण डेटा, प्रशिक्षण कोड, मध्यवर्ती चेकपॉइंट और लॉग के साथ भारों सहित जारी करता है। पहला OLMo फ़रवरी 2024 में आया, OLMo 2 उसी वर्ष नवम्बर में, और Olmo 3 नवम्बर 2025 में — Apache 2.0 के अंतर्गत 7B तथा 32B के Base, Instruct और Think रूपों के साथ। यही वह उदाहरण है जहाँ अलग-अलग जाँचने लायक चारों चीज़ें — कोड, भार, प्रशिक्षण का प्रकटीकरण और अनुज्ञप्ति — सचमुच प्रकाशित हैं, जिससे यह उन कुलों के सामने एक कसौटी बन जाता है जो केवल भार जारी करते हैं।

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

OpenAI के gpt-oss-120b और 20b डाउनलोड-योग्य MoE तर्कण मॉडल हैं, जो स्थानीय और होस्ट किए गए अनुमान के लिए बने हैं। इनके Apache 2.0 भार और संदर्भ कार्यान्वयन तैनाती की पहुँच बढ़ाते हैं, जबकि पूर्वप्रशिक्षण का डेटासेट स्वयं जारी नहीं किया गया।

  • open weights
  • reasoning
  • MoE
2026

GLM-5

Z.ai की GLM-5 शृंखला तर्कण, कोडिंग और लम्बी अवधि के एजेंट-कार्य के लिए बना एक बड़ा MoE भाषा-मॉडल कुल है। GLM-5 फ़रवरी 2026 में आया, 5.1 अप्रैल में, 5.2 जून में 753 अरब प्राचल और दस लाख टोकन की संदर्भ खिड़की के साथ, और 5.3 अगस्त में उसी आधार पर उत्तर-प्रशिक्षण के बदलावों के साथ; छोटा GLM-5.3-Flash कुछ ही दिन बाद कुल 320 अरब और 18 अरब सक्रिय प्राचल के साथ आया। बड़े सदस्यों का आकार स्वयं होस्ट करना संसाधन-गहन बना देता है।

  • open weights
  • MoE
  • long context
2026

Kimi K3

Moonshot AI ने जुलाई 2026 में Kimi K3 को खुले भार वाले, मूलतः बहुविध MoE भाषा-मॉडल के रूप में जारी किया — कुल 2.8 खरब प्राचल, 104 अरब सक्रिय प्राचल और दस लाख टोकन की संदर्भ खिड़की के साथ। यह लम्बी अवधि की कोडिंग, ज्ञान-कार्य और उपकरण चलाने वाले एजेंटों को लक्ष्य करता है, जबकि इसका आकार स्थानीय तैनाती को कठिन बना देता है।

  • open weights
  • MoE
  • long context

यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।