File tree Expand file tree Collapse file tree
Expand file tree Collapse file tree Original file line number Diff line number Diff line change @@ -501,8 +501,24 @@ async def _deduplicate_ideas(
501501 reset_files = reset_files ,
502502 ** dedup_run_opts ,
503503 )
504- if "mapped_report_text" in dedup_df .columns :
505- dedup_df ["report_text" ] = dedup_df ["mapped_report_text" ]
504+ mapped_col = "mapped_report_text"
505+ mapped_id_col = "mapped_report_text_ids"
506+ if mapped_col in dedup_df .columns :
507+ dedup_df ["report_text" ] = dedup_df [mapped_col ]
508+ if mapped_id_col in dedup_df .columns and "_dedup_id" in dedup_df .columns :
509+ rep_mask = dedup_df ["_dedup_id" ] == dedup_df [mapped_id_col ]
510+ rep_mask |= dedup_df ["_dedup_id" ].isna () & dedup_df [mapped_id_col ].isna ()
511+ dedup_df = dedup_df .loc [rep_mask ].copy ()
512+ print (
513+ "[Ideate] Collapsed to "
514+ f"{ len (dedup_df )} representative rows after deduplication."
515+ )
516+ elif mapped_col in dedup_df .columns :
517+ dedup_df = dedup_df .drop_duplicates (subset = [mapped_col ]).copy ()
518+ print (
519+ "[Ideate] Collapsed to "
520+ f"{ len (dedup_df )} representative rows after deduplication."
521+ )
506522 return dedup_df
507523
508524 def _clean_columns (self , df : pd .DataFrame ) -> pd .DataFrame :
You can’t perform that action at this time.
0 commit comments