LenserFight: Lokale eerst platform voor het evalueren van AI-agenten en prompts
LenserFight, door Conectlens, is een open platform voor het ontwerpen en benchmarken van AI-agenten, herbruikbare prompts en evaluatieworkflows. Het dient als een AI-laboratorium dat teams in staat stelt om versiegebonden "Lenses" te creëren, gerichte acyclische grafiekworkflows uit te voeren en evaluatie-evenementen te organiseren die rubric scoring combineren met menselijke beoordeling. De tool omvat een Model Context Protocol (MCP) server, lokale modeluitvoeringsopties en een openbare arena voor gedeelde logs. Doelgebruikers zijn AI-ontwikkelaars, promptingenieurs en onderzoekers die zich richten op reproduceerbare evaluatie en privébenchmarking.
Welke taken laat het platform je specificeren en reproduceren?
Het platform beschouwt een taak als een formele "Lens", een versie-specifieke specificatie die een prompt, evaluatierubrieken en een optioneel schema voor gestructureerde uitvoer combineert. Lenses fungeren als herbruikbare testgevallen zodat teams identieke instructies over modellen kunnen uitvoeren en versies kunnen behouden voor controleerbaarheid. Dit ontwerp ondersteunt gestructureerde evaluatie-artikelen in plaats van ad-hoc prompts, wat helpt bij het vergelijken van resultaten over modelruns of het repliceren van experimenten.
Hoe worden evaluatiescores geproduceerd en vergeleken?
Evaluatie-evenementen gebruiken een dual scoring model, waarbij geautomatiseerde rubriek scoring wordt gecombineerd met door de gemeenschap aangedreven menselijke stemmen om openbare ranglijsten en ELO-stijl rangschikkingen te produceren. De combinatie is bedoeld om objectieve rubrieksmetrics in balans te brengen met kwalitatieve menselijke oordelen. Betrouwbaarheid hangt af van het ontwerp van de rubriek en de steekproef van menselijke kiezers, dus vergelijkingen zijn alleen zo reproduceerbaar als de Lenses en de geregistreerde uitvoeringslogs die elke run vergezellen.
Welke invoer en uitvoeringsomgevingen worden ondersteund?
De MCP-server biedt meer dan dertig tools voor integratie met Model Context Protocol-clients, en het platform ondersteunt lokale modelorkestratie via Ollama, vLLM en llama.cpp. Webgebaseerde clients integreren via OAuth 2.1 PKCE. Die opties stellen teams in staat om zowel cloud-verbonden als offline experimenten uit te voeren, waardoor zij aan de slag kunnen met side-by-side benchmarking van lokale en externe assistenten via een enkele MCP-eindpunt.
Hoe past het platform in een privacybewuste workflow?
Het project hanteert een local-first houding, waardoor offline modelruns mogelijk zijn voor benchmarking en gegevensprivacy, terwijl ook een openbare gemeenschapsarena wordt aangeboden voor gedeelde logs en walkthroughs. De codebase is open source op GitHub en het project bevindt zich in een experimentele bètaversie, dus organisaties moeten plannen voor actieve ontwikkeling, gemeenschapsmoderatie van Battles en een technische opzetfase voordat ze erop vertrouwen voor formele evaluaties.
Het platform is geschikt voor technisch bekwame teams die op zoek zijn naar reproduceerbare, lokaal gecontroleerde modelvergelijkingen
Het platform is een praktische optie voor AI-ontwikkelaars en onderzoekers die configuratie-overhead accepteren om versiegebonden testartefacten en lokale uitvoeringscontrole te verkrijgen. De experimentele bètastatus en het door de gemeenschap aangedreven evaluatiemodel betekenen dat resultaten zorgvuldige rubricontwerpen en moderatie vereisen om betrouwbaar te zijn. Voor teams die reproduceerbare benchmarking en lokale modeluitvoeringen prioriteren, biedt het platform een duidelijk evaluatiekader; voor niet-technische gebruikers kan de complexiteit van de setup de onmiddellijke bruikbaarheid beperken.





