Methodforward x: [seq_len, batch_size, hidden_size] attention_mask: [batch_size, 1, seq_len, seq_len] rotary_pos_emb: [seq_len,
falcon1/models/modeling_falcon_tst.py:236
Methodforward x: [seq_len, batch_size, hidden_size] attention_mask: [batch_size, 1, seq_len, seq_len] rotary_pos_emb: [seq_len,
falcon1/models/modeling_falcon_tst.py:294