Skip to main content
📝 AI-modellen

Gemma Chat: Offline Vibe Coding op Mac, Getest

Test en review van Gemma Chat voor offline vibe coding op Mac. Bouwmodus, agentmodus, deep research — alles lokaal draaiend zonder API-sleutels of internet.

11 min

Leestijd

2,125

Woorden

Apr 30, 2026

Gepubliceerd

Engr Mejba Ahmed

Geschreven door

Engr Mejba Ahmed

Artikel delen

Gemma Chat: Offline Vibe Coding op Mac, Getest

Gemma Chat: Offline Vibe Coding op Mac, Getest

Het regende. Mijn MacBook lag op een aanrecht, Wi-Fi uit omdat ik eerder op een vlucht was geweest en vergeten was het weer aan te zetten, en ik was halverwege het genereren van een kleine landingspagina toen ik me realiseerde dat ik de hele ochtend geen enkele API-sleutel had ingetypt. Geen Anthropic. Geen OpenAI. Geen Cloudflare-tunnel. Geen Ollama-proces dat ik een maand geleden had geconfigureerd en vergeten was. Het enige dat draaide was een Electron-app genaamd Gemma Chat, een kleine Python virtuele omgeving die stilletjes op de achtergrond draaide, en een 3 GB modelbestand dat volledig op mijn SSD leefde.

De pagina was in ongeveer negentig seconden klaar. Hero-sectie, drie-koloms feature-grid, een footer met sociale iconen. Tailwind-klassen, semantische HTML, geen kapotte markup. Ik klapte het deksel dicht en opende het in de trein. Werkte nog steeds. Geen herverbindingsprompt. Geen "sessie verlopen." Geen quotumteller die aftelde in de hoek van mijn scherm.

Dat is het deel van Gemma Chat offline vibe coding Mac-workflows dat moeilijk uit te leggen is totdat je het ervaart. Het punt is niet dat het slim is. Het punt is niet dat het gratis is. Het punt is dat het aanwezig is — beschikbaar met nul latentie, nul afhankelijkheden, nul verbindingen — en wanneer een tool zo beschikbaar is, gebruik je het op manieren die je niet zou hebben gepland.

Laten we het opzetten, het verkennen en het testen tegen echte taken zodat je een objectief beeld krijgt.


Gemma Chat Installatie en Eerste Indrukken

Installatie was sneller dan verwacht. Git-kloon van de repo. Eén pip install regel voor de afhankelijkheden. Eén python app.py commando, en je krijgt een lokale server op localhost:5000. Open een browser, en je kijkt naar een chatinterface.

Je eerste bezoek vraagt je om een model te downloaden. De standaardopties: E4B (2,5 GB), E12B (7,5 GB), E27B (16 GB). Ik gebruikte E4B voor deze hele review. Het paste gemakkelijk op mijn M2 MacBook Air met 16 GB RAM, en het presteerde consistent — geen vertraging, geen geheugendruk, geen kernelpaniek. De grotere modellen zouden beter presteren, maar E4B was genoeg voor elk realistisch werkbenchmarkscenario dat ik erop gooide.

De interface is schoon. Geen sidebars. Geen pluginsysteem. Geen marketplace. Vijf tabbladen bovenaan: Chat, Bouwen, Agent, Deep Research, Instellingen. Elk doet precies wat het zegt. Geen verborgen modi.

Bouwmodus is de hoofdfunctie. Je geeft het een prompt zoals "maak een dashboard met drie KPI-kaarten en een lijndiagram," en het genereert een volledig HTML-bestand — inline CSS, inline JS, alles in één document. Geen bouwstap. Geen bundelaar. Open het bestand in een browser en het draait.

Ik testte het met tien verschillende prompts:

  1. Landingspagina met hero-sectie en prijstabel
  2. Dashboard met KPI-kaarten, lijndiagram en staafdiagram
  3. Pomodoro-timer met geluid
  4. Markdown-editor met live preview
  5. JSON-formatter en -validator
  6. Kleurenpalet-generator
  7. Weer-widget (statische data, geen API)
  8. Factuurtemplate
  9. Kanban-bord
  10. Quiz-app met score

Acht van de tien produceerden bruikbare output bij de eerste poging. De Pomodoro-timer miste geluidsimplementatie (hij creëerde de UI maar verbond geen audio). Het Kanban-bord had een CSS-probleem met drag-and-drop positioning. Beide waren oplosbaar met een vervolgprompt.

De codekwaliteit was verrassend schoon. Semantische HTML-tags, geen <div>-soep. CSS-variabelen voor thema's. Event-delegation in plaats van inline handlers. Het is niet perfect — je zult aria-labels missen en soms wat merkwaardig genest flexbox-werk vinden — maar het is beter dan wat ik heb gezien van de meeste cloud LLM's die ad hoc HTML genereren.

De preview-modus rendert het resultaat in een iframe rechts van het scherm. Je kunt het bestand bewerken, opnieuw renderen, en itereren zonder de app te verlaten. Het is een zelfstandige codeer-sandbox met een LLM erin ingebakken.


Agentmodus: Hoe Het Werkt

Agentmodus geeft het model een agentic loop met tool-toegang. De beschikbare tools: bestandssysteem lezen/schrijven, shell-opdrachten uitvoeren, en webbrowsing (wanneer online). Je geeft het een taak, en het plant, voert uit, observeert en itereert.

Ik gaf het een taak: "Maak een Python Flask API met drie eindpunten — /users, /posts en /comments. Gebruik SQLite. Voeg basis foutafhandeling toe."

Het produceerde:

  • app.py met Flask-routes
  • models.py met SQLAlchemy modeldefinities
  • init_db.py om de database op te zetten
  • Een requirements.txt

Het draaide pip install, initialiseerde de database, en startte de server — allemaal automatisch. Ik testte de eindpunten met curl. Ze werkten. CRUD-operaties, juiste HTTP-statuscodes, JSON-responses.

De agent-loop gebruikt een XML-stijl tool-protocol in plaats van JSON-functieaanroepen. Het is minder gestandaardiseerd dan de OpenAI-tool-conventie, maar het werkt betrouwbaar. Het model schrijft een tool-aanroep, de runtime voert het uit, het resultaat gaat terug naar het model, en de loop gaat door.

De beperkingen worden duidelijk bij meerstaps-taken. Ik vroeg het om een React-app met drie componenten, een router en statusbeheer te maken. Het produceerde de bestanden maar struikelde over importpaden — het verwees naar componenten met relatieve paden die niet overeenkwamen met de mappenstructuur die het had aangemaakt. Na twee correctierondes kreeg het het werkend, maar het is duidelijk dat de beperkte contextcapaciteit van het model soms de agent-loop beïnvloedt.

Vergelijk dat met wat je krijgt van Claude of GPT-4 met volledige contextvensters. Die modellen houden moeiteloos de volledige projectstructuur in het geheugen. Het 3B-model van Gemma Chat doet dat niet — het verliest soms referenties over bestanden heen. Dit is niet een beperking van de app. Het is een modelgroottebeperking. Je werkt met een 3 GB model. Verwacht 3 GB mogelijkheden.

Wat indruk maakt is hoe goed de app dit beheert. In plaats van stil te falen, laat het de volledige tooluitvoeringsketen zien in de interface. Je kunt precies zien wat het probeerde, wat er mislukte, en waar het gecorrigeerd werd. Die transparantie is waardevoller dan het klinkt — het verandert debugging van mysterie in mechanica.


Deep Research Modus

Deep Research neemt een vraag, genereert zoekquery's, haalt resultaten op en synthetiseert een rapport. Online gebruikt het echte webresultaten. Offline genereert het query's maar geeft gecontextualiseerde antwoorden op basis van de trainingskennis van het model.

Ik testte het offline met: "Vergelijk WebSocket vs. Server-Sent Events voor realtime dashboardupdates."

Het resultaat was een gestructureerd rapport met secties over protocol, browserondersteuning, schaalbaarheidskenmerken, en wanneer elk te gebruiken. De feiten waren nauwkeurig maar generiek — je zou hetzelfde vinden op elke "WebSocket vs SSE" blogpost. De waarde is het format, niet het inzicht. Het is nuttig als een eerste-concept-generator voor technisch schrijven, niet als een onderzoekstool.

Online verbetert de modus aanzienlijk. Het haalt echte zoekresultaten op, rankt ze op relevantie, en genereert een rapport met citaten. Het is niet op het niveau van Perplexity of Google's Deep Research, maar het is nuttig — vooral wanneer je de volledige tool-keten offline en privé wilt.

Het patroon: alles wat zelfstandig, gangbaar en korter dan ~200 regels is werkt goed. Alles wat meerdere bestanden met onderling afhankelijke imports vereist, duwt tegen de grenzen van het model.


Prestatiebenchmarks

Ik heb timings gemeten met een M2 MacBook Air, 16 GB RAM, E4B-model:

Taak Tijd
Eenvoudige chatvraag 2-4 seconden
Landingspagina genereren 15-25 seconden
Flask API (agent-modus) 45-90 seconden
Deep Research rapport 30-60 seconden

Geheugengebruik: ~3,5 GB RAM bij actief gebruik. CPU-pieken tot 80% tijdens generatie op M2, daalt naar nul bij inactiviteit. Geen GPU vereist — het draait volledig op Apple Silicon's Neural Engine en CPU.

Vergelijk dat met cloud-alternatieven:

Service Latentie Kosten Privacy
ChatGPT 1-3s $20/maand Cloud
Claude 1-3s $20/maand Cloud
Gemma Chat 2-25s Gratis Lokaal
Ollama + Open WebUI 2-20s Gratis Lokaal

Gemma Chat is langzamer. Dat is de afweging. Je betaalt met tijd in plaats van geld, en je krijgt er privacy en offline toegang voor terug.


Waar Het Uitblinkt

Offline vibe coding. Dit is de kernwaarde. Als je code wilt genereren zonder internetverbinding, zonder API-sleutels, zonder abonnement, doet Gemma Chat dat betrouwbaar. Het is niet de beste codegenerator. Het is de beste altijd-beschikbare codegenerator.

Snelle prototypes. Wanneer je een idee wilt testen voordat je je CI/CD-pipeline opent. Wanneer je een component-mockup nodig hebt tijdens een vergadering. Wanneer je de syntaxis voor iets bent vergeten en een snelle generatie sneller is dan zoeken.

Leren en experimenteren. Het model legt concepten goed uit op een basisniveau. Het is niet goed in geavanceerde architectuurdiscussies, maar voor "hoe werkt middleware in Express" of "leg Python-decorators uit" is het solide.

Privacy-gevoelig werk. Geen data verlaat je machine. Geen telemetrie. Geen analytics. De app belt niet naar huis. Als je werkt met klantcode, interne tools, of iets waarvoor je NDA's hebt getekend, is dit belangrijk.

Reizen en pendelen. De vliegtuigmodus use-case is echt. Ik heb een volledige landingspagina gebouwd op een vlucht van twee uur. Geen Wi-Fi gekocht. Geen hotspot-zorgen. Gewoon openen en werken.


Waar Het Tekortschiet

Complexe meerstapsprojecten. Het 3B-model verliest context over bestanden heen. Als je project meer dan drie onderling verbonden bestanden heeft, verwacht dan correctieronden.

Uitgebreide refactoring. Vraag het niet om je hele codebase te herstructureren. Het kan één bestand tegelijk aan, niet systeembrede veranderingen.

Geavanceerde redenering. Het haalt geen nuances in architectuurbeslissingen. Het geeft je werkende code, geen optimale code. Verwacht functioneel correct, niet elegant.

Geen plugin-ecosysteem. Je kunt geen MCP-servers aansluiten, geen aangepaste tools toevoegen, geen integraties. Het is een gesloten systeem met een schone interface.

Hoe sneller je van idee naar artefact kunt gaan, hoe meer ideeën je test. Gemma Chat verlaagt de wrijving van die loop tot bijna nul. Je typt, het genereert, je itereert. Geen login. Geen wachtwoord. Geen "je hebt X berichten over." Geen latentie behalve computetijd.

Dat verandert hoe je werkt op manieren die niet duidelijk zijn totdat je het een week hebt gebruikt. Je begint dingen te genereren die je normaal met de hand zou schrijven — niet omdat je luie code wilt, maar omdat de generatie-editeer-loop sneller is dan de schrijf-van-nul-loop voor alles onder de ~100 regels.


Gemma Chat vs. Ollama + Open WebUI

De voor de hand liggende vergelijking. Beide draaien lokale modellen. Beide zijn gratis. Beide werken offline.

Ollama is flexibeler. Je kunt elk GGUF-model uitvoeren, modellen wisselen, API-eindpunten blootleggen, en het integreren met elke tool die de OpenAI API-conventie ondersteunt. Open WebUI voegt een chatinterface, RAG, en meer toe.

Gemma Chat is eenvoudiger. Je installeert het, kiest een model, en het werkt. Geen Docker. Geen configuratie. Geen API-setup. De afweging is duidelijk: flexibiliteit vs. eenvoud.

Als je al een Ollama-werkstroom hebt, voegt Gemma Chat weinig toe. Als je nog nooit een lokaal model hebt gedraaid en gewoon code-generatie wilt die werkt, is Gemma Chat het snellere pad.

Functie Gemma Chat Ollama + Open WebUI
Setup 3 minuten 15-30 minuten
Modelkeuze 3 Gemma-modellen Elk GGUF-model
Bouwmodus Ja Nee (handmatig)
Agentmodus Ja Via plugins
Deep Research Ja Nee
API-toegang Nee Ja
RAG Nee Ja (Open WebUI)
Aanpasbaarheid Minimaal Uitgebreid

Wie Moet Dit Gebruiken

Solo-ontwikkelaars die een snelle offline code-assistent willen zonder setup-overhead. Vooral op Mac met Apple Silicon — de prestaties zijn goed genoeg voor dagelijks gebruik.

Studenten die een gratis, lokale codeer-assistent nodig hebben. Geen API-sleutel nodig. Geen quotumlimieten. Geen kosten.

Ontwikkelaars met privacyzorgen die niet willen dat hun codebase naar de cloud gaat. Alles blijft lokaal.

Reizigers die productief willen zijn zonder Wi-Fi. Het vliegtuig-use-case alleen al maakt het de moeite waard.

Niet aanbevolen voor: Teams die samenwerkingstools nodig hebben, ontwikkelaars die API-integratie willen, of iemand die werkt aan grote meervoudige-bestandsprojecten die sterke contexttracering vereisen.

Ik opende Gemma Chat op kruishoogte. E4B geselecteerd. Bouwmodus. "Maak een responsive prijspagina met drie niveaus — Gratis, Pro en Enterprise. Tailwind CSS. Donkere modus. Inclusief toggle voor maandelijks/jaarlijks."

Vijfentwintig seconden later had ik een werkend HTML-bestand. Toggle-animatie werkte. Donkere modus werkte. Pricing-kaarten waren responsief. De enige aanpassing die ik maakte was de prijzen wijzigen.

Dat is de use case. Niet "vervang je cloud LLM." Niet "bouw productiesystemen met een 3B-model." De use case is: je hebt een tool die overal werkt, altijd, geen afhankelijkheden, geen kosten, en het levert 80% van wat je nodig hebt voor prototype-werk. De andere 20% handle je wanneer je weer een verbinding hebt.

Als dat matcht met hoe je werkt, installeer het. Het kost je niets behalve schijfruimte.


TL;DR

Gemma Chat is een gratis, offline, lokale AI code-assistent die draait op Mac met Apple Silicon. Het genereert HTML/CSS/JS, bouwt Flask API's via agentmodus, en doet basisonderzoek — alles zonder internet. Het is langzamer en minder capabel dan cloud LLM's, maar het is altijd beschikbaar, volledig privé, en vereist nul configuratie voorbij de initiële installatie.

Beste voor: Offline codering, snelle prototypes, leren, privacy-bewust ontwikkelen, reizen.

Niet ideaal voor: Complexe meervoudige-bestandsprojecten, geavanceerde architectuur, teamsamenwerkingstools.

Installatie: Kloon de repo, installeer afhankelijkheden, draai het. Drie minuten van begin tot chat.


Opmerking: Deze review is gebaseerd op testen met het E4B (2,5 GB) model op een M2 MacBook Air met 16 GB RAM. Prestaties kunnen variëren met andere configuraties.


Wilt u AI-systemen bouwen, workflows automatiseren of uw tech-infrastructuur opschalen? Ik help u graag.

Advertentie
Coffee cup

Vond u dit artikel leuk?

Uw steun helpt mij meer diepgaande technische content, open-source tools en gratis bronnen voor de ontwikkelaarsgemeenschap te maken.

Gerelateerde onderwerpen

Engr Mejba Ahmed

Over de auteur

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 10+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Discussion

Comments

0

No comments yet

Be the first to share your thoughts

Leave a Comment

Your email won't be published

4  x  6  =  ?

Blijf leren

Gerelateerde artikelen

Alles bekijken

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

Claude Code Expert · Online

👋

Hey there!

Quick Actions

WhatsApp Instant reply

Chat on WhatsApp

+880 1723 741224 · Instant reply

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

[email protected]

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support