import re import requests EXTRACT_RULES = { "mailto_links": { "selector": "a[href^='mailto:']", "type": "obj", "multiple": True, "children": { "email": {"selector": "", "type": "attr", "attribute": "href"} } }, "page_content": {"selector": "body", "type": "text"} } response = requests.post("https://api.ujeebu.com/scrape", headers={"ApiKey": "YOUR_API_KEY", "Content-Type": "application/json"}, json={ "url": "https://example.com/contact", "extract_rules": EXTRACT_RULES }) data = response.json()["result"] # Regex for email addresses email_pattern = r'[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}' # From mailto links mailto_emails = [ link["email"].replace("mailto:", "").split("?")[0] for link in data.get("mailto_links", []) ] # From page content using regex content_emails = re.findall(email_pattern, data.get("page_content", "")) # Combine and deduplicate all_emails = list(set(mailto_emails + content_emails)) print(f"Found {len(all_emails)} unique emails: {all_emails}")