()
| 646 | |
| 647 | |
| 648 | def main() -> None: |
| 649 | load_dotenv(override=True) |
| 650 | args = parse_args() |
| 651 | ensure_output_path(args.output) |
| 652 | |
| 653 | experiment_meta = { |
| 654 | "timestamp": datetime.utcnow().isoformat() + "Z", |
| 655 | "system_prompt": INFERENCE_SYSTEM_PROMPT, |
| 656 | "evaluation_instruction": EVALUATION_INSTRUCTION, |
| 657 | "evaluation_system_prompt": EVALUATION_SYSTEM_PROMPT, |
| 658 | "max_step": args.max_step, |
| 659 | "max_samples": args.max_samples, |
| 660 | } |
| 661 | |
| 662 | if args.output.exists(): |
| 663 | with args.output.open("r", encoding="utf-8") as f: |
| 664 | results: Dict[str, Any] = json.load(f) |
| 665 | else: |
| 666 | results = {} |
| 667 | |
| 668 | results.setdefault("meta", {}) |
| 669 | results["meta"].update(experiment_meta) |
| 670 | results.setdefault("models", {}) |
| 671 | |
| 672 | save_results(results, args.output) |
| 673 | |
| 674 | agent_runner: Optional[ToolCallingAgentRunner] = None |
| 675 | if args.use_tool_agent: |
| 676 | try: |
| 677 | agent_runner = build_tool_calling_agent_runner( |
| 678 | agent_name=args.agent_name, |
| 679 | config_path=args.agent_config, |
| 680 | cfg_options=args.agent_cfg_options, |
| 681 | ) |
| 682 | except Exception as exc: |
| 683 | print(f"[工具代理初始化失败] {exc}") |
| 684 | sys.exit(1) |
| 685 | |
| 686 | for model_name in args.models: |
| 687 | try: |
| 688 | engine = tg.get_engine(model_name) |
| 689 | except ValueError as exc: |
| 690 | print(f"[跳过模型] {model_name}: {exc}") |
| 691 | results["models"][model_name] = {"error": str(exc)} |
| 692 | save_results(results, args.output) |
| 693 | continue |
| 694 | |
| 695 | system_prompt_var = Variable( |
| 696 | INFERENCE_SYSTEM_PROMPT, |
| 697 | requires_grad=False, |
| 698 | role_description="system prompt specifying reasoning format", |
| 699 | ) |
| 700 | if agent_runner: |
| 701 | model = ToolCallingAgentLLM(agent_runner, system_prompt_var) |
| 702 | else: |
| 703 | model = BlackboxLLM(engine=engine, system_prompt=system_prompt_var) |
| 704 | |
| 705 | model_results = results["models"].setdefault(model_name, {}) |
no test coverage detected