Een skill die je honderd keer hebt gebruikt zit vaak op tachtig procent. Goed genoeg om dagelijks in te zetten, niet goed genoeg om blind te vertrouwen. Deze workflow pakt die laatste twintig procent. Je legt eerst vast wanneer de skill goed werkt, in vragen die met ja of nee te beantwoorden zijn. Die vragen vormen samen één score. Daarna verandert de AI per ronde precies één ding aan de skill, scoort de nieuwe versie tegen dezelfde vragen, en houdt alleen wat hoger scoort.
Autoresearch is de kern van dit concept: probeer iets, meet het tegen één objectieve score, hou wat werkt, gooi de rest weg, herhaal. Andrej Karpathy liet op die manier een AI-agent tientallen experimenten achter elkaar draaien. Hier draait dezelfde loop op jouw skills, maar bewaakt. Maximaal tien rondes, elke wijziging zichtbaar in je scherm, en niets gaat door zonder dat jij ja zegt. Vooraf wordt een backup weggeschreven, dus je kunt altijd terug.
Reken op een half uur om de criteria en testcases vast te leggen, daarna draait de loop zelf. Je hebt een skill nodig die je al vaker hebt gebruikt en waarvan je concreet kunt opschrijven wanneer hij faalt. Heb je dat niet, dan weigert de workflow en zegt hij wat je eerst moet verzamelen. Voor kenniswerkers die hun AI-omgeving serieus laten meegroeien.
Plan een vrijblijvende kennismaking. We kijken samen waar AI jou het meeste oplevert, in gewone taal.