Format evaluation results into a readable summary string Args: results_dict: Dictionary containing evaluation results Returns: Formatted summary string
(results_dict: Dict[str, Any])
| 98 | |
| 99 | |
| 100 | def format_results_summary(results_dict: Dict[str, Any]) -> str: |
| 101 | """ |
| 102 | Format evaluation results into a readable summary string |
| 103 | |
| 104 | Args: |
| 105 | results_dict: Dictionary containing evaluation results |
| 106 | |
| 107 | Returns: |
| 108 | Formatted summary string |
| 109 | """ |
| 110 | summary_lines = ["MBench Evaluation Results Summary", "=" * 40] |
| 111 | |
| 112 | for dimension, result in results_dict.items(): |
| 113 | summary_lines.append(f"\n{dimension}:") |
| 114 | |
| 115 | if isinstance(result, dict): |
| 116 | if 'error' in result: |
| 117 | summary_lines.append(f" Error: {result['error']}") |
| 118 | else: |
| 119 | for key, value in result.items(): |
| 120 | if isinstance(value, (int, float)): |
| 121 | if key.lower() in ['accuracy', 'score', 'metric']: |
| 122 | summary_lines.append(f" {key}: {value:.4f}") |
| 123 | else: |
| 124 | summary_lines.append(f" {key}: {value}") |
| 125 | elif not isinstance(value, (list, dict)): |
| 126 | summary_lines.append(f" {key}: {value}") |
| 127 | else: |
| 128 | summary_lines.append(f" Result: {result}") |
| 129 | |
| 130 | return "\n".join(summary_lines) |
| 131 | |
| 132 | |
| 133 | def ensure_directory_exists(path: str) -> None: |
nothing calls this directly
no outgoing calls
no test coverage detected