dataset_path: Cloudriver/PhyX
dataset_name: data_for_llms_eval
dataset_kwargs:
  token: True
doc_to_visual: !function utils.phyx_doc_to_visual
doc_to_text: !function utils.phyx_doc_to_text
doc_to_messages: !function utils.phyx_doc_to_messages
doc_to_target: "answer"
output_type: generate_until

metric_list:
  - metric: acc_score
    aggregation: mean
    higher_is_better: true
  - metric: format_score
    aggregation: mean
    higher_is_better: true

generation_kwargs:
  max_new_tokens: 49152

metadata:
  version: 0.0
