Sweetheart is ontworpen rond Rig, zodat de engine erachter een configuratiedetail is en niet iets dat in de app is ingebakken. De architectuur zet die op precies één plek, en die plek is niet de server.
Status. Sweetheart is nog niet gebouwd. Deze pagina beschrijft het vastgestelde ontwerp, zodat beheerders kunnen zien wat een deployment wel en niet nodig zal hebben; het is geen beschrijving van gedrag dat vandaag draait.
Waar de inferentie ontworpen is om te draaien
De desktop-app is ontworpen voor inferentie uitsluitend op het apparaat zelf. mistral.rs
wordt in het Tauri-proces ingebed, met het model volledig draaiend op de machine van de
gebruiker: geen inferentie aan de serverkant, geen Ollama- of vLLM-sidecar, en geen route
via een externe API. Het modelbestand komt op het apparaat te staan, en prompts zijn niet
ontworpen om het te verlaten.
Dat is een bewuste eerste stap en geen beperking om omheen te werken. Het bewijst het verhaal van lokale AI van begin tot eind, en het betekent dat een zelf gehoste deployment helemaal geen GPU nodig heeft — inferentie kost de host niets, omdat het gebeurt op hardware die de gebruiker al heeft.
Wat dat betekent voor zelf hosten
Er is geen AI-configuratie op de server. De backend leest geen model-, provider- of API-key-variabelen, en er een toevoegen zou geen effect hebben. Niets op de pagina Configuratie heeft met Sweetheart te maken, en dat is juist en geen omissie.
Retrieval is het ene onderdeel waar de server wél bij betrokken is, en dat is geen
inferentie. De desktop-app gaat zowel je content als je zoekopdrachten lokaal embedden en
stuurt de resulterende vector naar Postgres, dat de gelijkeniszoektocht met pgvector
uitvoert. Een vectorzoekopdracht is een databasebewerking, dus de lijn "geen AI aan de
serverkant" houdt stand. Offline valt de app terug op vectorzoeken over zijn lokale cache,
zodat retrieval ook zonder verbinding blijft werken.
Wat er later komt
Twee verdere niveaus zijn ontworpen maar bewust uitgesteld, en ze komen mee met de platformen die ze nodig hebben — browsers en telefoons kunnen geen lokaal model draaien, en juist daardoor wordt inferentie aan de serverkant noodzakelijk.
- Zelf gehoste serverinferentie. Een Ollama- of vLLM-sidecar achter Rig, voor deployments met GPU-budget en voor clients die zelf geen model kunnen draaien.
- Externe providers. Frontier-modellen via de providerrouter van Rig, per organisatie aan te zetten en met expliciete toestemming.
Omdat het ontwerp overal op Rig mikt, is het toevoegen van die niveaus bedoeld als configuratie en niet als herbouw. Tot ze er zijn, is een model- of API-key-instelling aan de serverkant niets wat je mist — het bestaat niet.