Omslag van 484 – Waarom lokale AI vooral een hardwarehobby is

// podcast_episode

Aflevering 484

484 – Waarom lokale AI vooral een hardwarehobby is

Ivo geeft zijn agent geheugen. Tristan laat Kimi K3 draaien op anderhalve terabyte RAM. Lokale AI blijkt vooral een hardwarehobby.

Een AI-agent die je mail beantwoordt, taken onthoudt en zichzelf verbetert klinkt al snel als sciencefiction. Ivo Toby bouwt hem gewoon zelf. Met Talon geeft hij modellen gereedschap en grenzen; Postgram maakt zijn notities, vergaderingen en taken doorzoekbaar voor elke agent. Tristan Suerink kijkt naar de andere kant: het ijzer dat al dat denkwerk mogelijk maakt. Hij draaide Kimi K3 op een IBM Power11-machine met twee terabyte werkgeheugen en nam een halve AI-winkel mee naar de studio. Van tweedehands AMD-kaarten en een DGX Spark tot een 800-gigabitnetwerkkaart, alles komt op tafel. We bespreken wanneer lokale modellen goed genoeg zijn, waarom goedkope modellen betere opdrachten nodig hebben, hoe je een AI-server voor vijftig collega’s bouwt en waarom datacenters straks zelfs hun restwarmte en algenproblemen moeten temmen.

Hoofdstukken

De tijden zijn gerekend vanaf het begin van de aflevering.

  1. Intro: agentgeheugen, VRAM en een tafel vol hardware
  2. Talon: een begrensde AI-agent via mail en Telegram
  3. Kimi K3 draaien op twee terabyte werkgeheugen
  4. Kleine lokale modellen en de knipperende doucheventilator
  5. Zes uur gratis programmeren met Qwen en een strenge reviewer
  6. Luistervraag van Boba: lokale AI voor vijftig collega's
  7. Een 800-gigabitnetwerkkaart voor de AI-fabriek
  8. Postgram geeft al je agents hetzelfde geheugen
  9. Takenlijsten, dagelijkse planning en zelfverbeterende agents
  10. Tweefasekoeling, datacenteralgen en warmte in de grond

Over Ivo Toby

Ivo Toby is Senior (AI) Software Engineer bij Contentful. Hij bouwt opensourcehulpmiddelen voor AI-agents, waaronder Talon en meerdere MCP-servers, en schreef bij Contentful over vectordatabases. In deze aflevering laat hij zien hoe hij lokale modellen, modelroutering en een centraal agentgeheugen inzet.

Over Tristan Suerink

Tristan Suerink is IT-architect en netwerkarchitect bij Nikhef. Hij bouwt en test reken-, opslag- en netwerkinfrastructuur voor deeltjesfysica, waaronder snelle dataverbindingen voor CERN-onderzoek. In deze aflevering legt hij uit hoeveel hardware lokale AI echt vraagt en waarom tweefasekoeling onvermijdelijk wordt.

Genoemd in deze aflevering

Tips van de tafel

Ivo Toby: Laat een groot model je opdracht aanscherpen als een klein lokaal model hem niet begrijpt; betere afbakening kan uren gratis rekenwerk bruikbaar maken.

Ivo Toby: Houd je eigen notities als bron van waarheid en indexeer ze daarna voor agents, zodat je niet vastzit aan één model of apparaat.

Tristan Suerink: Koop voor één lokale AI-machine eerder een AMD Ryzen AI Halo dan een DGX Spark; het AMD-kastje is goedkoper als je niet hoeft te clusteren.

Randal Peelen: Automatiseer de omlijsting, maar houd mensenwerk in je kernproduct; bij MNOT zit de liefde in de gemonteerde audio.

Transcript

Lees het volledige transcript (18.881 woorden)

Het transcript wordt geladen zodra je dit onderdeel opent.

Open een volledige printversie