„Vibe-Check“ ist keine gute Teststrategie bei Software. Wer LLMs in Produktion bringt, braucht AI Evals. Martin Seeler erklärt, wie ihr mit LLM-as-a-Judge und Error Analysis eure GenAI-Produkte stabil bekommt. 🎧 Jetzt hören auf programmier.bar/podcast/deep-dive-205-ai-evals-mit-martin-seeler
0 likes 0 replies
?