AI Agents evaluieren ist gerade noch oft: vibes, Demo, Bauchgefühl. Harbor will das etwas erwachsener machen: Agenten benchmarken, eigene Evals bauen, tausende Umgebungen parallel fahren, RL-Rollouts erzeugen. Für alle, die tiefer rein wollen. github.com/harbor-frame...
1 likes 0 replies
?