import random from agent_reliability_toolkit.live_eval import bisect_failures def live_bisect(agent, eval_cases, max_failures=5): actual_failures = [] for case in random.sample(eval_cases, len(eval_cases)): result = agent(case['input']) if not result['success']: actual_failures.append((case, result)) if len(actual_failures) >= max_failures: break return actual_failures # Archive these for manual inspection and regression