Competition Benchmarking via n8n & Python Content Scraping
Designed and executed a bulk URL scraping and content extraction exercise using an n8n and Python pipeline to benchmark content against Mayo Clinic, WebMD, and Apollo Pharmacy.
Analysis covered both quantitative dimensions (content volume, attribute coverage) and qualitative dimensions (depth, accuracy, user-friendliness).
Findings were used to prioritise content gaps and inform attribute expansion decisions.

The Challenge
- No systematic view existed of how Tata 1mg's content compared to international health information standards.
- Scraping and structuring content at scale across multiple competitor platforms required a robust, repeatable technical pipeline.
The Approach & Solution
- Built a Python and n8n-assisted scraping pipeline using BeautifulSoup4 and Pandas to extract and structure content from competitor URLs at scale.
- Designed a comparison framework mapping content attributes across platforms.
- Synthesised findings into a prioritised roadmap for content improvements.
Key Results & Commercial Impact
Technology Stack & Tools
Have a similar project in mind?
We specialize in custom AI systems, clinical data licensing pipelines, and scalable web apps. Let's build something exceptional together.
Explore More Projects

Google Health Partnership
Packaged clinical content as LLM training data, including drug monographs, DDI data, disease content, and regulatory safety data, in a B2B monetization deal.

Samsung Health API Integration
Real-time API integration spanning 600K+ SKUs, 50+ attributes, and a 200K-interaction DDI tool, enabling in-app discovery and routing cart/checkout to Tata 1mg.

Elsevier Clinical Monograph API Partnership
Tata 1mg's first clinical content licensing deal. Delivered 1,500 structured drug monographs over 9 months and built the CMS & API infrastructure.