Data Science & Generative AI

Die Innovationsplattform Data Science & Generative AI unterstützt Industriepartner dabei, Daten in messbaren Mehrwert zu verwandeln. An unseren Standorten in Hamburg, Frankfurt, Berlin, Göttingen und Penzberg entwickelt das Fraunhofer ITMP robuste Analyse-Workflows und modellbasierte Tools für die biomedizinische Forschung, pharmazeutische Entwicklung, Diagnostik und für industrielle Anwendungen.

Im Fokus stehen durchgängige End-to-end Prozesse: von verlässlichem Datenmanagement über reproduzierbare Analysen bis hin zu skalierbaren Lösungen, die höchsten Industrie- und Compliance-Anforderungen gerecht werden. So helfen wir Unternehmen, Entwicklungszyklen zu verkürzen, Prozesse zu stabilisieren und vorhandene Datenpotenziale besser zu nutzen.

Unser Ansatz ermöglicht schnellere Innovation, reduziert Risiken im Betrieb und stärkt nachhaltig die Wettbewerbsfähigkeit in dynamischen Märkten.

 

Kernkompetenzen:

  • Integration multimodaler Daten (Omics-, Prozess-, Bild-, klinische, chemische, biologische und experimentelle Daten)
  • Machine Learning, Deep Learning und Entwicklung von Foundation Models für wissenschaftliche und industrielle Anwendungen
  • Generative KI für Moleküldesign, synthetische Daten, Textverarbeitung und Prozessoptimierung
  • Cloud-native Infrastrukturen und skalierbare Data-Engineering-Lösungen
  • Expertise in regulatorisch konformer, vertrauenswürdiger und erklärbarer KI für sensible Forschungsumgebungen

 

Ziele/Angebote:

  • Entwicklung skalierbarer End-to-end data science workflows für Forschung, Diagnostik und industrielle Prozesse
  • Konzeption, Training und Einsatz generativer KI-Modelle für Simulation, Wissensextraktion und multimodale Datengenerierung
  • Aufbau sicherer, regelkonformer Datenökosysteme für standortübergreifende Zusammenarbeit und effiziente Data-Governance
  • KI-gestützte Automatisierung von Labor-, Screening- und Analyseprozessen zur Steigerung von Effizienz und Reproduzierbarkeit
  • Strategische Beratung, Machbarkeitsstudien und Co-Creation Formate für datengetriebene Innovationsprojekt

IDERHA

IDERHA ist eine europäische öffentlich-private Partnerschaft, die im April 2023 ins Leben gerufen wurde. Dieses bahnbrechende Projekt befasst sich mit den Hindernissen, die dem Zugang, der Integration und der Analyse von Gesundheitsdaten im Wege stehen, um ihren Wert für die Patientenversorgung und die medizinische Forschung zu maximieren.

Im Rahmen von IDERHA wird ein offener, krankheitsunabhängiger, föderierter Datenraum entwickelt. Der föderierte Datenraum ermöglicht Konnektivität, Zugang, Nutzung und Wiederverwendung von digitalen Gesundheitsdaten. Im Rahmen von IDERHA werden konsensfähige politische Empfehlungen für den Zugang zu Gesundheitsdaten und heterogener Gesundheitsforschung, wie z. B. Real-World-Evidence (RWE), für die Entscheidungsfindung in den Bereichen Regulierung und HTA entwickelt.

Partner: IDERHA wird geleitet von Fraunhofer ITMP und Johnson & Johnson Medical GmbH in einem Konsortium aus 33 akademischen, klinischen, medizintechnischen, pharmazeutischen und IT-Partnern sowie Patientenorganisationen und Behörden, darunter die Fraunhofer-Institute SCAI und ISST. 

Weiterführende Informationen

SYNTHIA

SYNTHIA ist eine ehrgeizige Zusammenarbeit zwischen öffentlichen und privaten Institutionen, um die verantwortungsvolle Nutzung von synthetischen Daten (SD) in Gesundheitsanwendungen zu erleichtern. Das Projekt wird die methodischen und technischen Aspekte der Generierung von SD durch die Entwicklung neuer und die Weiterentwicklung etablierter Techniken für verschiedene Datenmodalitäten, einschließlich Genomik und Bildgebung, verbessern, um die Generierung realistischer, multimodaler und longitudinaler Daten zu verbessern.

Die offene SYNTHIA-Verbundplattform wird die verantwortungsvolle Nutzung von SD durch die Gesundheitsforschungsgemeinschaft erleichtern, insbesondere den langfristigen Zugang zu umfassend validierten, wiederverwendbaren synthetischen Datensätzen sowie zu SD-Workflows und SD-Bewertungsrahmen. Die multidisziplinäre Zusammenarbeit von SD-Entwicklern, FAIR-Datenexperten, klinischen Forschern, Entwicklern von Therapien und datenbasierten Werkzeugen, Rechtsexperten, sozioökonomischen Analysten, Regulierungsexperten, politischen Befürwortern und Kommunikationsexperten wird eine 360°-Sicht darauf bieten, wie Gesundheitsanwendungen durch die Nutzung von SD vorangebracht werden können.

Partner: Das Konsortium umfasst 43 akademische, klinische, pharmazeutische, IT- und öffentliche Partner, darunter die Fraunhofer-Institut für Algorithmen und Wissenschaftliches Rechnen SCAI, das Fraunhofer-Institut für Digitale Medizin MEVIS sowie das Fraunhofer-Institut für Translationale Medizin und Pharmakologie ITMP.

Weiterführende Informationen

FAIRplus

Die riesigen Datenmengen, die in der biowissenschaftlichen Forschung entstehen, haben das Potenzial, unser Verständnis von Krankheiten zu verbessern und die Entwicklung von Medikamenten voranzutreiben. Doch die meisten Daten sind in proprietären Datenbanken versiegelt und in unterschiedlichen Formaten gespeichert. Ziel von FAIRplus ist es, Leitlinien und Werkzeuge bereitzustellen, die die Anwendung der FAIR-Prinzipien auf Daten aus bestimmten IMI-Projekten und auf Datensätze von Pharmaunternehmen erleichtern. FAIR steht für »auffindbar, zugänglich, interoperabel, wiederverwendbar« (findable, accessible, interoperable, reusable). Das Projekt wird es somit anderen Forschern erleichtern, die Daten zu finden und in ihre eigene Forschung zu integrieren. Das Projekt wird auch Schulungskurse für Datenwissenschaftler in Universitäten, kleinen und mittleren Unternehmen (KMU) und Pharmaunternehmen organisieren. Letztendlich hofft das Projekt, die Kultur des Datenmanagements in den Biowissenschaften zu verändern.

Weiterführende Informationen

Wissensgraphen-Generator

Im Rahmen des inzwischen abgeschlossenen Projekts Wissensgraphen-Generator (KGG), wurde ein automatisierter Workflow zur Generierung von Wissensgraphen für die Biowissenschaften entwickelt, der eine umfassende Darstellung von krankheitsassoziierten Entitäten wie Proteinen, Signalwegen, genetischen Varianten, Chemikalien, Wirkmechanismen, Assays und Nebenwirkungen ermöglicht. Durch die Integration kuratierter Ressourcen wie OpenTargets, UniProt, ChEMBL, der Integrated Interactions Database und GWAS Central hat KGG FAIR-konforme, miteinander verbundene Graphen erstellt, die komplexe wissenschaftliche Abfragen und nachgelagerte Analysen unterstützen.

Das Projekt hat den praktischen Wert von Wissensgraphen in der translationalen und anwendungsorientierten Forschung aufgezeigt. Zu den Anwendungsfällen gehörten die Identifizierung gemeinsamer molekularer Einheiten zur Erforschung von Komorbiditäten, die Entdeckung mutmaßlicher therapeutischer Ziele, die Umwidmung von Wirkstoffkandidaten für die Parkinson-Krankheit und die Bewertung der Arzneimittelähnlichkeit von Chemikalien.

Diese Ergebnisse unterstreichen das Potenzial von KGG, die industrielle Forschung und Entwicklung zu beschleunigen, indem es präklinische Erkenntnisse mit umsetzbaren Erkenntnissen für die Arzneimittelentwicklung verbindet und Innovationen näher an den Markt bringt.

Die Ressourcen und der Quellcode von KGG sind für die Forschungsgemeinschaft öffentlich zugänglich: Weiterführende Informationen

Weng J, Ju F, Lyu Z, Fan N, Smit DJ, Xu W, Wu X, Becker P, Xu Y, Schweiger MR, Hillmer AM, Harwig R, Gul S, Link A, Meder L, Fang N, Dong Q, Bruns CJ, Ren N, Zhao Y. Single-cell insights into tumor microenvironment heterogeneity and plasticity: transforming precision therapy in gastrointestinal cancers.
J Exp Clin Cancer Res. 2025 Nov 28;44(1):314
doi: 10.1186/s13046-025-03567-5

Tanoli Z, Fernández-Torras A, Özcan UO, Kushnir A, Nader KM, Gadiya Y, Fiorenza L, Ianevski A, Vähä-Koskela M, Miihkinen M, Seemab U, Leinonen H, Seashore-Ludlow B, Tampere M, Kalman A, Ballante F, Benfenati E, Saunders G, Potdar S, Gómez García I, García-Serna R, Talarico C, Beccari AR, Schaal W, …, Aittokallio T. "Computational drug repurposing: approaches, evaluation of in silico resources and case studies." 
Nat Rev Drug Discov. 2025;24:521–542.
doi: 10.1038/s41573-025-00567-8

Kuzikov M, et al. "Experimental and machine learning-based exploration of repurposed drugs reveals chemical features underlying phospholipidosis."
Patterns. 2025;101453.
doi: 10.1016/j.patter.2025.101453

Karki R, Gadiya Y, Zaliani A, Pokharel B, Babaiha NS, Ostaszewski M, Hofmann-Apitius M, Gribbon P. "KGG: a fully automated workflow for creating disease-specific knowledge graphs." 
Bioinformatics. 2025 Jul;41(7):btaf383.
doi: 10.1093/bioinformatics/btaf383