ESTOI Evaluation of Selection Policies

As stated in the paper, we observe similar trends when the selection policy is evaluated using ESTOI. The results (averaged over 16 speaker pairs) for PET–3 and URA–4+ arrays are shown below.

ESTOI results for PET-3 array

PET–3 Array

ESTOI results for URA-4+ array

URA–4+ Array

The relative performance and ranking of selection policies under ESTOI are consistent with those observed using SI-SDRi.

In the following, we presents audio samples where source-array distance is maintained as 1m. Star (★) marks our proposed policy selection.

Example 2: Learned speaker ordering in Location-based Training; when swapping speakers' azimuth, the output speakers are also swapped.

1.1: Speaker 1-- Male at 0°, Speaker 2-- Female at 140°
Mixture Ground Truth LBT-CO (Baseline) LBT-FLO (θ = 0°) ★ LBT-FLO (θ = 90°)
Mixture



Speaker 1



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 2



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 2 (PET-3)



1.2: Speaker 1-- Female at 0°, Speaker 2-- Male at 140°
Mixture Ground Truth LBT-CO (Baseline) LBT-FLO (θ = 0°) ★ LBT-FLO (θ = 90°)
Mixture



Speaker 1



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 2



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Example 2: Alternative LBT-FLO Selection in Anechoic Conditions

With Speaker 1 fixed at 40°, LBT-FLO (θ = 0°) is selected when Speaker 2 is located at 140°, whereas LBT-FLO (θ = 90°) is selected when Speaker 2 is at 300°. In both cases, the selected LBT-FLO configurations achieve separation performance that is better than the LBT-CO baseline.

2.1: Speaker 1-- Male at 40°, Speaker 2-- Female at 140°
Mixture Ground Truth LBT-CO (Baseline) LBT-FLO (θ = 0°) ★ LBT-FLO (θ = 90°)
Mixture



Speaker 1



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 2



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 2 (PET-3)



2.2: Speaker 1-- Male at 40°, Speaker 2-- Female at 300°
Mixture Ground Truth LBT-CO (Baseline) LBT-FLO (θ = 0°) LBT-FLO (θ = 90°) ★
Mixture



Speaker 1



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 2



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Example 3: Consistent advantage of CLBT-FLOs across array geometries in Anechoic Condition

For both PET-3 and URA-4+ array geometries, a same scenario where Speaker 1 located at 0° and Speaker 2 located at 140° is inferenced, the selected LBT-FLO (θ = 0°) achieve consistently better separation performance than the LBT-CO baseline.

Speaker 1-- Male at 0°, Speaker 2-- Male at 140°
Mixture Ground Truth LBT-CO (Baseline) LBT-FLO (θ = 0°) ★ LBT-FLO (θ = 90°)
Mixture



Speaker 1



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 2



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 1



Speaker 1 (URA-4+)



Speaker 1 (URA-4+)



Speaker 1 (URA-4+)



Speaker 2



Speaker 2 (URA-4+)



Speaker 2 (URA-4+)



Speaker 2 (URA-4+)



Example 4: Consistent advantage of CLBT-FLOs across array geometries in Reverberant Condition

For both PET-3 and URA-4+ array geometries, a same scenario where Speaker 1 located at 0° and Speaker 2 located at 140° is inferenced, the selected LBT-FLO (θ = 0°) achieve consistently better separation performance than the LBT-CO baseline.

Speaker 1-- Female at 0°, Speaker 2-- Female at 140°
Mixture Ground Truth LBT-CO (Baseline) LBT-FLO (θ = 0°) ★ LBT-FLO (θ = 90°)
Mixture



Speaker 1



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 1 (PET-3)



Speaker 2



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 2 (PET-3)



Speaker 1



Speaker 1 (URA-4+)



Speaker 1 (URA-4+)



Speaker 1 (URA-4+)



Speaker 2



Speaker 2 (URA-4+)



Speaker 2 (URA-4+)



Speaker 2 (URA-4+)