TECHNOLOGY GRAPH
AI 기술 체계
모델 아키텍처와 학습부터 추론, 배포, 오픈 웨이트 모델 사례까지
연구 아이디어를 학습 가능한 모델과 사용 가능한 시스템으로 잇는 기술 지도다. 각 항목은 논문, 역사적 시기, 모델 사례, 도구, 1차 출처로 연결된다.
모델 아키텍처
모델이 정보를 표현하고 변환하는 구조다.
Transformer
어텐션을 중심으로 시퀀스 위치를 병렬 처리하는 신경망 아키텍처다. 현대의 많은 언어 및 멀티모달 모델의 기반이 되었다.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
라우팅된 전문가 하위 네트워크를 조합하는 아키텍처 계열이다. 현대의 희소 변형은 입력마다 일부 전문가만 활성화해 모든 토큰에서 전체 매개변수를 쓰지 않고도 용량을 늘린다.
- experts
- router
- sparse activation
Diffusion Model
점진적으로 노이즈를 더하는 과정을 되돌리도록 학습하는 생성 모델이다. 반복적 노이즈 제거는 이미지·오디오·비디오·멀티모달 생성의 주요 방식이 되었다.
- forward noise
- denoising
- score matching
프레임워크와 표현
모델 구축, 학습, 실행에 쓰는 소프트웨어와 데이터 인터페이스다.
PyTorch
텐서, 자동 미분, 신경망 모듈, 컴파일, 분산 실행을 제공하는 오픈 소스 딥러닝 프레임워크다. 연구 프로토타입부터 운영 학습까지 널리 쓰인다.
- tensor
- autograd
- module
Hugging Face Transformers
사전 학습 아키텍처를 학습 및 추론 생태계에 연결하는 모델 정의 라이브러리다. 설정, 전처리, 로딩, 생성과 여러 작업 인터페이스를 표준화한다.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
원시 텍스트를 모델이 처리하는 이산 단위로 매핑하는 과정이다. 어휘 구성과 분할 방식은 시퀀스 길이, 다국어 범위, 비용, 모델 동작에 영향을 준다.
- token
- vocabulary
- BPE
학습과 사후 학습
모델 능력과 행동을 형성하는 확장, 적응, 선호 기법이다.
Distributed Training
데이터, 매개변수, 활성값 또는 연산을 여러 장치와 노드에 분할하는 기술이다. 대규모 모델 학습을 가능하게 하지만 통신, 동기화, 내결함성의 절충이 따른다.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
지시 따르기와 선호 정렬 행동을 가르치는 사후 학습 기법군이다. SFT는 시연에서 학습하고, RLHF와 DPO는 서로 다른 최적화 절차로 선호 비교를 활용한다.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
답을 내기 전에 긴 추론 흔적을 생성하도록, 그리고 문제가 어려울수록 추론 단계에서 더 많은 연산을 쓰도록 가르치는 후학습 방법군이다. 검증 가능한 보상을 쓰는 강화학습, 즉 대조 가능한 정답이 학습 신호를 제공하는 방식이 이 노선을 폐쇄된 연구실 밖에서도 재현 가능하게 만들었다. 대가는 분명히 적어 둘 만하다. 정확도는 더 큰 모델이 아니라 생성 길이에서 오며, 그 값은 지연 시간과 서빙 비용으로 치른다.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
기본 가중치를 고정하고 작은 저랭크 어댑터만 학습하는 매개변수 효율적 미세 조정 기법이다. QLoRA는 양자화된 기본 모델을 결합해 메모리 사용을 더 줄인다.
- low-rank adapters
- frozen base model
- 4-bit training
추론과 배포
모델 서빙에 쓰는 메모리, 스케줄링, 압축, 런타임 기술이다.
Quantization
가중치, 활성값 또는 캐시를 낮은 수치 정밀도로 표현하는 기술이다. 메모리, 대역폭, 연산 비용을 줄이지만 정확도와 하드웨어 지원의 절충이 있다.
- precision
- INT8
- INT4
KV Cache
자기회귀 생성 중 이전 토큰의 어텐션 키와 값을 저장하는 캐시다. 전체 접두부 재계산을 피하지만 주요 메모리 소비원이 되기 쉽다.
- keys
- values
- prefill
Continuous Batching / PagedAttention
요청을 계속 받아들이고 완료하면서 KV 캐시 메모리를 페이지 단위로 관리하는 서빙 기술이다. 가변 길이 워크로드에서 활용률과 처리량을 높인다.
- request scheduling
- memory paging
- throughput
Speculative Decoding
더 빠른 초안 모델이 여러 토큰을 제안하고 대상 모델이 병렬로 검증하는 추론 기법이다. 대상 분포를 바꾸지 않고 생성 지연을 줄일 수 있다.
- draft model
- verification
- latency
Open-model Inference Ecosystem
vLLM과 llama.cpp 같은 엔진 및 런타임은 내려받은 모델 가중치를 로컬 또는 서버 추론으로 연결한다. 처리량, 하드웨어 이식성, 형식, 운영 복잡성에서 우선순위가 다르다.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
애플리케이션 아키텍처
모델은 워크플로, 도구, 컨텍스트 교환, 안전장치, 평가를 거쳐 제품이 된다. 이 응용 계층은 기존 MCP와 도구 섹션으로 연결해 중복을 피한다.
오픈 모델 사례
코드, 가중치, 학습 공개, 라이선스 네 축으로 모델군을 살핀다.
Llama
Meta의 다운로드 가능한 가중치 모델군은 로컬 추론과 후속 미세 조정을 확대했다. Llama 전용 조건을 사용하므로 OSI식 오픈 소스라 단정하기보다 오픈 웨이트가 정확하다.
- open weights
- community license
- model family
Qwen
Alibaba의 Qwen 계열은 밀집형, 전문가 라우팅, 다국어, 멀티모달 릴리스를 아우른다. 많은 체크포인트를 내려받을 수 있지만 라이선스와 공개 범위는 개별 모델 카드에서 확인해야 한다.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Mistral AI 계열에는 밀집형 Mistral과 전문가 라우팅형 Mixtral이 함께 있다. 허용적 라이선스인 릴리스와 아닌 릴리스가 있어 공개성은 산출물별로 판단해야 한다.
- dense models
- MoE
- open weights
DeepSeek
DeepSeek의 다운로드 가능한 릴리스는 MoE 설계, 추론 후처리 학습, 효율적 서빙에 대한 연구를 확산했다. 코드와 가중치는 라이선스가 다를 수 있고 학습 데이터 공개는 별도 축이다.
- MoE
- reasoning
- open weights
Gemma
Google의 다운로드 가능한 가중치 모델군은 Gemini 계열 연구를 로컬, 엣지, 호스팅 배포에 연결한다. Google은 오픈 모델이라 부르지만 사용에는 Gemma 전용 조건이 적용된다.
- open weights
- lightweight models
- edge deployment
OLMo
Ai2가 공개하는 OLMo 계열은 가중치와 함께 사전 학습 데이터, 학습 코드, 중간 체크포인트, 학습 로그까지 공개한다. 첫 OLMo는 2024년 2월에, OLMo 2는 같은 해 11월에 나왔고, Olmo 3는 2025년 11월에 7B와 32B의 Base·Instruct·Think 변형으로 Apache 2.0 아래 공개되었다. 코드, 가중치, 학습 공개, 라이선스라는 따로 확인해야 할 네 가지가 모두 실제로 공개된 사례이며, 가중치만 공개하는 계열을 견주어 볼 기준이 된다.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
OpenAI의 gpt-oss-120b와 20b는 로컬 및 호스팅 추론을 위한 다운로드 가능한 MoE 추론 모델이다. Apache 2.0 가중치와 참조 구현은 배포 선택지를 넓히지만 사전 학습 데이터셋 자체는 공개되지 않았다.
- open weights
- reasoning
- MoE
GLM-5
Z.ai의 GLM-5 계열은 추론, 코딩, 장기 에이전트 작업을 위한 대규모 MoE 언어 모델군이다. GLM-5는 2026년 2월에 등장했고 5.1이 4월, 5.2가 6월에 7530억 파라미터와 100만 토큰 컨텍스트로, 5.3이 8월에 같은 기반 모델의 사후 학습으로 공개되었다. 더 작은 GLM-5.3-Flash는 며칠 뒤 총 3200억, 활성 180억 파라미터로 나왔다. 큰 구성원의 규모는 자체 호스팅에 많은 연산 자원을 요구한다.
- open weights
- MoE
- long context
Kimi K3
Moonshot AI는 2026년 7월 총 2.8조, 활성 1,040억 매개변수와 100만 토큰 컨텍스트를 갖춘 오픈 웨이트 네이티브 멀티모달 MoE 언어 모델 Kimi K3를 공개했다. 장기 코딩, 지식 작업, 도구 사용 에이전트를 겨냥하지만 로컬 배포에는 많은 자원이 필요하다.
- open weights
- MoE
- long context
선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.