Ivo geeft zijn agent geheugen. Tristan laat Kimi K3 draaien op anderhalve terabyte RAM. Lokale AI blijkt vooral een hardwarehobby.
Een AI-agent die je mail beantwoordt, taken onthoudt en zichzelf verbetert klinkt al snel als sciencefiction. Ivo Toby bouwt hem gewoon zelf. Met Talon geeft hij modellen gereedschap en grenzen; Postgram maakt zijn notities, vergaderingen en taken doorzoekbaar voor elke agent. Tristan Suerink kijkt naar de andere kant: het ijzer dat al dat denkwerk mogelijk maakt. Hij draaide Kimi K3 op een IBM Power11-machine met twee terabyte werkgeheugen en nam een halve AI-winkel mee naar de studio. Van tweedehands AMD-kaarten en een DGX Spark tot een 800-gigabitnetwerkkaart, alles komt op tafel. We bespreken wanneer lokale modellen goed genoeg zijn, waarom goedkope modellen betere opdrachten nodig hebben, hoe je een AI-server voor vijftig collega’s bouwt en waarom datacenters straks zelfs hun restwarmte en algenproblemen moeten temmen.
Hoofdstukken
De tijden zijn gerekend vanaf het begin van de aflevering.
- Intro: agentgeheugen, VRAM en een tafel vol hardware
- Talon: een begrensde AI-agent via mail en Telegram
- Kimi K3 draaien op twee terabyte werkgeheugen
- Kleine lokale modellen en de knipperende doucheventilator
- Zes uur gratis programmeren met Qwen en een strenge reviewer
- Luistervraag van Boba: lokale AI voor vijftig collega's
- Een 800-gigabitnetwerkkaart voor de AI-fabriek
- Postgram geeft al je agents hetzelfde geheugen
- Takenlijsten, dagelijkse planning en zelfverbeterende agents
- Tweefasekoeling, datacenteralgen en warmte in de grond
Over Ivo Toby
Ivo Toby is Senior (AI) Software Engineer bij Contentful. Hij bouwt opensourcehulpmiddelen voor AI-agents, waaronder Talon en meerdere MCP-servers, en schreef bij Contentful over vectordatabases. In deze aflevering laat hij zien hoe hij lokale modellen, modelroutering en een centraal agentgeheugen inzet.
Over Tristan Suerink
Tristan Suerink is IT-architect en netwerkarchitect bij Nikhef. Hij bouwt en test reken-, opslag- en netwerkinfrastructuur voor deeltjesfysica, waaronder snelle dataverbindingen voor CERN-onderzoek. In deze aflevering legt hij uit hoeveel hardware lokale AI echt vraagt en waarom tweefasekoeling onvermijdelijk wordt.
Genoemd in deze aflevering
- Talon, Ivo’s zelfgehoste agentruntime met duidelijke grenzen
- Kimi K3, open-weightsmodel van Moonshot AI met 2,8 biljoen parameters
- Qwen3.6, compacte open modellen voor lokaal agentwerk
- OpenClaw, zelfgehoste persoonlijke AI-agent voor meerdere kanalen
- NVIDIA DGX Spark, klein AI-kastje met 128 GB gedeeld geheugen
- AMD Ryzen AI Halo, lokaal AI-platform met 128 GB gedeeld geheugen
- Maxsun Intel Arc Pro B60 Dual, dubbele Intel-GPU met samen 48 GB geheugen
- Obsidian, notities in gewone lokale Markdown-bestanden
- pgvector, semantisch zoeken in PostgreSQL
- Wetenschapsdag bij Nikhef, open dag op 3 oktober 2026
Tips van de tafel
Ivo Toby: Laat een groot model je opdracht aanscherpen als een klein lokaal model hem niet begrijpt; betere afbakening kan uren gratis rekenwerk bruikbaar maken.
Ivo Toby: Houd je eigen notities als bron van waarheid en indexeer ze daarna voor agents, zodat je niet vastzit aan één model of apparaat.
Tristan Suerink: Koop voor één lokale AI-machine eerder een AMD Ryzen AI Halo dan een DGX Spark; het AMD-kastje is goedkoper als je niet hoeft te clusteren.
Randal Peelen: Automatiseer de omlijsting, maar houd mensenwerk in je kernproduct; bij MNOT zit de liefde in de gemonteerde audio.