Data Scientist

TheCorporate
Woodlawn, Maryland, United StatesFull-timePosted Aug 28, 2026

About the role

Job Summary

We are seeking an experienced Data Scientist with strong expertise in Python, SQL, Natural Language Processing (NLP), entity resolution, record linkage, and large-scale data processing.

The ideal candidate will have hands-on experience developing sophisticated data processing and entity resolution pipelines, working with structured and unstructured data, optimizing complex database operations, and translating advanced matching and scoring algorithms into clear business logic.

This role will support the end-to-end delivery of data solutions, including data discovery, cleansing, validation, testing, deployment, monitoring, and optimization.

Key Responsibilities

Design, develop, implement, and maintain advanced data processing and entity resolution pipelines using Python and SQL.

Apply NLP and information extraction techniques to process and extract insights from unstructured data, including:

Named Entity Recognition (NER)

String distance metrics

TF-IDF

Cosine similarity

Phonetic encoding

Address standardization

Clean, transform, standardize, and manage large-scale datasets from complex and diverse data sources.

Ensure data integrity, quality, security, and privacy throughout data processing workflows.

Develop and optimize complex SQL queries and database operations for performance, scalability, and reliability.

Develop solutions for record linkage, entity resolution, and data deduplication.

Implement blocking and indexing strategies to efficiently process large datasets.

Support end-to-end data solution delivery, including:

Data discovery

Data validation

Testing

Deployment

Post-implementation monitoring

Participate in code reviews and enforce version control, coding standards, reproducibility, and data privacy practices.

Translate complex algorithmic decisions, including match thresholds and probabilistic scoring, into clear and understandable business logic.

Communicate technical findings and algorithmic approaches effectively to both technical teams and non-technical stakeholders.

Qualifications & Requirements

10+ years of IT industry experience.

Bachelor's degree in Statistics, Applied Mathematics, Computer Science, Information Science, or a related field (or equivalent experience).

Proven expertise in NLP and information extraction, including:

Named Entity Recognition (NER)

String distance metrics, TF-IDF, Cosine similarity, Phonetic encoding, Address standardization

Strong hands-on Python skills for building analytics solutions and scalable data pipelines.

Advanced SQL skills, including query optimization and complex database operations.

Proficiency with Regex for text processing, pattern matching, and data cleansing.

Experience with record linkage and deduplication libraries such as:

Splink / FastLink

Dedupe

Recordlinkage

Experience using spaCy for NLP and scikit-learn for machine learning and clustering.

Strong understanding of data quality, integrity, security, and privacy principles.

Excellent written and verbal communication skills, with the ability to translate technical concepts for diverse audiences.

Preferred / Nice-to-Have Qualifications

Experience delivering data initiatives in federal, state, or local government environments.

Experience retrieving, processing, and migrating data from legacy and distributed systems, including:

PostgreSQL, DB2, Oracle, SQL Server, Hadoop, Flat files

Experience with Jenkins and CI/CD for automating data validation and processing pipelines.

Experience with pipeline automation, scheduling, and monitoring tools for complex data cleansing and processing jobs.

Proven ability to own data pipeline architecture end-to-end, from initial data discovery through post-implementation monitoring.

Experience designing scalable data processing solutions for large and complex datasets.

Experience developing reproducible and production-ready data science solutions.

Technical Skills

Programming: Python, SQL, Regex

NLP / Information Extraction: NER, spaCy, TF-IDF, Cosine Similarity, String Distance Metrics, Phonetic Encoding, Address Standardization

Machine Learning: scikit-learn, Clustering

Entity Resolution: Record Linkage, Entity Resolution, Deduplication, Blocking, Indexing, Splink/FastLink, Dedupe, Recordlinkage

Databases: PostgreSQL, DB2, Oracle, SQL Server, Greenplum/Hadoop environments as applicable

Data Engineering: Data Pipelines, Data Cleansing, Data Transformation, Data Validation, Data Migration, Pipeline Monitoring

DevOps / CI/CD: Jenkins, Version Control, Automated Data Validation

Data Concepts: Data Integrity, Data Quality, Data Privacy, Data Security, Reproducibility

Education

Bachelor's degree in Statistics, Applied Mathematics, Computer Science, Information Science, or a related field — or equivalent professional experience.

[Add information regarding benefits and perks here]

Skills: sql,data,nlp,data validation,public trust,pipelines,regex,processing

Responsibilities

  • Design, develop, implement, and maintain advanced data processing and entity resolution pipelines using Python and SQL
  • Apply NLP and information extraction techniques to process and extract insights from unstructured data
  • Clean, transform, standardize, and manage large-scale datasets from complex and diverse data sources
  • Ensure data integrity, quality, security, and privacy throughout data processing workflows
  • Develop and optimize complex SQL queries and database operations for performance, scalability, and reliability
  • Support end-to-end data solution delivery, including data discovery, validation, testing, deployment, and monitoring
  • Translate complex algorithmic decisions into clear and understandable business logic
  • Communicate technical findings and algorithmic approaches effectively to both technical teams and non-technical stakeholders

Qualifications

  • 10+ years of IT industry experience
  • Bachelor's degree in Statistics, Applied Mathematics, Computer Science, Information Science, or a related field
  • Proven expertise in NLP and information extraction
  • Strong hands-on Python skills for building analytics solutions and scalable data pipelines
  • Advanced SQL skills, including query optimization and complex database operations
  • Proficiency with Regex for text processing and data cleansing
  • Experience with record linkage and deduplication libraries
  • Strong understanding of data quality, integrity, security, and privacy principles

Skills mentioned

PythonSQLScikit-learnData PipelinesETLApache HadoopPostgreSQLQuery OptimizationJenkinsCI/CD

About TheCorporate

The Corporate is a forward-thinking business solutions partner focused on helping organizations align strategy, people, and processes to drive sustainable growth. With a strong emphasis on practical execution and measurable outcomes, we work closely with businesses to unlock opportunities and improve overall performance. Our approach combines deep insights, operational excellence, and strategic alignment to deliver impactful results. From streamlining operations to building scalable growth frameworks, we enable companies to achieve clarity, efficiency, and long-term success. We specialize in: Business strategy & planning Operational optimization Growth and scalability solutions Data-driven insights and decision-making Trusted by clients globally, our mission is simple — to transform challenges into opportunities and help businesses grow smarter, faster, and stronger. At The Corporate, we don’t just advise — we partner, execute, and deliver.

Software Development11-50 employeesBrooklyn, New York