()
| 160 | |
| 161 | |
| 162 | async def main(): |
| 163 | parser = argparse.ArgumentParser(description='Test Benchmark Loop') |
| 164 | parser.add_argument("--config", default=os.path.join(root, "configs", "tool_calling_agent.py"), help="config file path") |
| 165 | parser.add_argument("--benchmark", default="aime25", help="benchmark name to test") |
| 166 | parser.add_argument( |
| 167 | '--cfg-options', |
| 168 | nargs='+', |
| 169 | action=DictAction, |
| 170 | help='override settings') |
| 171 | args = parser.parse_args() |
| 172 | |
| 173 | config.initialize(config_path=args.config, args=args) |
| 174 | logger.initialize(config=config) |
| 175 | |
| 176 | logger.info("| 🧠 Initializing model manager...") |
| 177 | if hasattr(model_manager, 'initialize'): |
| 178 | await model_manager.initialize() |
| 179 | |
| 180 | benchmark_name = args.benchmark |
| 181 | logger.info(f"| 🛠️ Initializing benchmark manager for {benchmark_name}...") |
| 182 | await benchmark_manager.initialize(benchmark_names=[benchmark_name]) |
| 183 | |
| 184 | await test_math_benchmark(benchmark_name) |
| 185 | |
| 186 | print("| 🧹 Cleaning up...") |
| 187 | await benchmark_manager.cleanup() |
| 188 | print("| 🚪 Test completed") |
| 189 | |
| 190 | if __name__ == "__main__": |
| 191 | asyncio.run(main()) |
no test coverage detected