# AI Machine > How the AI machine is set up: llama.cpp inference servers on two GPUs, model configuration, Docker services, and networking. > Raw markdown mirror: https://docs.na.id.au/raw/ai-docs/ - [01 — Architecture](https://docs.na.id.au/ai-docs/01-architecture/) — ## The two-tier pattern (raw: https://docs.na.id.au/raw/ai-docs/01-architecture.md) - [02 — Context Sizing & Model Quantisation](https://docs.na.id.au/ai-docs/02-context-and-quantisation/) — ## The VRAM budget equation (raw: https://docs.na.id.au/raw/ai-docs/02-context-and-quantisation.md) - [03 — Primary vs Secondary `llama-server`](https://docs.na.id.au/ai-docs/03-primary-vs-secondary/) — ## Why two servers, not one (raw: https://docs.na.id.au/raw/ai-docs/03-primary-vs-secondary.md) - [04 — Sub-agent Use](https://docs.na.id.au/ai-docs/04-sub-agents/) — ## The core idea (raw: https://docs.na.id.au/raw/ai-docs/04-sub-agents.md) - [05 — Open Terminal & Tooling](https://docs.na.id.au/ai-docs/05-open-terminal-and-tooling/) — ## What Open Terminal is (raw: https://docs.na.id.au/raw/ai-docs/05-open-terminal-and-tooling.md) - [06 — Skills](https://docs.na.id.au/ai-docs/06-skills/) — ## What a skill is (raw: https://docs.na.id.au/raw/ai-docs/06-skills.md) - [07 — Dual-Use: Inference Server ⇄ Gaming/Desktop](https://docs.na.id.au/ai-docs/07-dual-use-gaming/) — ## The problem (raw: https://docs.na.id.au/raw/ai-docs/07-dual-use-gaming.md) - [08 — Build Instructions](https://docs.na.id.au/ai-docs/08-build-instructions/) — ## How to build from scratch (raw: https://docs.na.id.au/raw/ai-docs/08-build-instructions.md) - [AI Machine — Concepts & Tips](https://docs.na.id.au/ai-docs/README/) — This directory documents a self-hosted AI inference and application stack: native `llama.cpp` inference servers on the GPUs, fronted by a Docker application tier (Open WebUI, Open Terminal, Pipelines)… (raw: https://docs.na.id.au/raw/ai-docs/README.md)