Samenvatting H7 genetica
, Challenges of Next Generation Sequencing
o High error rate: 0,1 % errors
o 1 human genome
~3 million sequencing errors
Sequence each genome > 40 times
o DNA sequencing → individuele DNA-moleculen één voor één uitgelezen
o Massieve parallelle sequenering
Miljoenen DNA-fragmenten gelijktijdig te sequeneren
Technologie enorm krachtig
Intrinsieke foutenmarge (~0,1%) = 3 miljoen fouten per volledig
genoom
Echte varianten onderscheiden van sequencing-errors → DNA
meer dan 40 keer opnieuw gesequeneerd
→ Echte varianten verschijnen consequent in vele reads terwijl
fouten slechts sporadisch voorkomen
o Afbeelding
Links: 2 keer g opgedoken → fout (false positive sequencing)
→ kan ook opgetreden zijn later in de ontwikkeling → persoon is
mozaïek voor de mutatie → wanneer gaat dit doorgegeven
worden?
Rechts: in ongeveer 50% van de reads is de g aanwezig (we
hebben 2 chromosomen dus heterozygoot voor de g)
→ op paternele chromosoom de novo variant
Applications – Shallow Whole Genome sequencing
o Sequencing was tot voor kort redelijk duur
→ Shallow sequencing= maar 1 keer sequeneren of deeltje van genoom
Shallow Whole Genome
Sequencing (0,1x- 10x coverage) →
CNV sequencing
o Techniek levert slechts
0,1x tot 10x coverage
o Voldoende om grote
kopiegetalveranderingen
(CNV’s) op te sporen
Coverage analysis is easy
o Resolution dependent on
#reads and DNA quality
o Short-read sequencing
, Ongeveer 150 baseparen uitgelezen
Belangrijke beperking: zulke korte stukjes zijn moeilijk correct te
plaatsen in het genoom, vooral in repeat-regio’s waar veel
sequenties sterk op elkaar lijken
Daarom worden alle reads na sequencing gemapt op een
referentiegenoom, waarna we een coverage plot opstellen
In silico wordt het genoom opgedeeld in windows of bins (bv 1000
bp) en tellen we hoeveel reads in elke bin terechtkomen (+
corrigeren)
Na normalisatie ontstaat een grafiek die toont waar er meer of
minder reads zijn dan verwacht
In een patiënt met een duplicatie zien we in die bin een
systematische
verhoging van de
coverage omdat dat
chromosomale
segment vaker
voorkomt en vaker
wordt gesequeneerd
(↔ bij deletie: bins met
minder reads dan
verwacht)
High resolution copy number analysis
o Methode om zeer nauwkeurig
deleties en duplicaties (CNV’s) in
het genoom op te sporen
o Afbeelding 1
Duplicatie en deletie
Elk bolletje is een afgebakend window
Bij short-read sequencing ontstaat altijd een gat in de data t.h.v.
centromeer (komt omdat centromeren bijna uitsluitend bestaan
uit zeer repetitieve sequenties = repeat regio’s)
Sequencing werd uiteindelijk veel eenvoudiger en toegankelijker
dan microarrays → vereisen vooraf ontworpen probes en hebben
vaste resolutie
o Afbeelding 2
5 miljoen nucleotiden
ontbreken
Elk bolletje is een
window
Deletie aan begin
chromosoom 2
, Challenges of Next Generation Sequencing
o High error rate: 0,1 % errors
o 1 human genome
~3 million sequencing errors
Sequence each genome > 40 times
o DNA sequencing → individuele DNA-moleculen één voor één uitgelezen
o Massieve parallelle sequenering
Miljoenen DNA-fragmenten gelijktijdig te sequeneren
Technologie enorm krachtig
Intrinsieke foutenmarge (~0,1%) = 3 miljoen fouten per volledig
genoom
Echte varianten onderscheiden van sequencing-errors → DNA
meer dan 40 keer opnieuw gesequeneerd
→ Echte varianten verschijnen consequent in vele reads terwijl
fouten slechts sporadisch voorkomen
o Afbeelding
Links: 2 keer g opgedoken → fout (false positive sequencing)
→ kan ook opgetreden zijn later in de ontwikkeling → persoon is
mozaïek voor de mutatie → wanneer gaat dit doorgegeven
worden?
Rechts: in ongeveer 50% van de reads is de g aanwezig (we
hebben 2 chromosomen dus heterozygoot voor de g)
→ op paternele chromosoom de novo variant
Applications – Shallow Whole Genome sequencing
o Sequencing was tot voor kort redelijk duur
→ Shallow sequencing= maar 1 keer sequeneren of deeltje van genoom
Shallow Whole Genome
Sequencing (0,1x- 10x coverage) →
CNV sequencing
o Techniek levert slechts
0,1x tot 10x coverage
o Voldoende om grote
kopiegetalveranderingen
(CNV’s) op te sporen
Coverage analysis is easy
o Resolution dependent on
#reads and DNA quality
o Short-read sequencing
, Ongeveer 150 baseparen uitgelezen
Belangrijke beperking: zulke korte stukjes zijn moeilijk correct te
plaatsen in het genoom, vooral in repeat-regio’s waar veel
sequenties sterk op elkaar lijken
Daarom worden alle reads na sequencing gemapt op een
referentiegenoom, waarna we een coverage plot opstellen
In silico wordt het genoom opgedeeld in windows of bins (bv 1000
bp) en tellen we hoeveel reads in elke bin terechtkomen (+
corrigeren)
Na normalisatie ontstaat een grafiek die toont waar er meer of
minder reads zijn dan verwacht
In een patiënt met een duplicatie zien we in die bin een
systematische
verhoging van de
coverage omdat dat
chromosomale
segment vaker
voorkomt en vaker
wordt gesequeneerd
(↔ bij deletie: bins met
minder reads dan
verwacht)
High resolution copy number analysis
o Methode om zeer nauwkeurig
deleties en duplicaties (CNV’s) in
het genoom op te sporen
o Afbeelding 1
Duplicatie en deletie
Elk bolletje is een afgebakend window
Bij short-read sequencing ontstaat altijd een gat in de data t.h.v.
centromeer (komt omdat centromeren bijna uitsluitend bestaan
uit zeer repetitieve sequenties = repeat regio’s)
Sequencing werd uiteindelijk veel eenvoudiger en toegankelijker
dan microarrays → vereisen vooraf ontworpen probes en hebben
vaste resolutie
o Afbeelding 2
5 miljoen nucleotiden
ontbreken
Elk bolletje is een
window
Deletie aan begin
chromosoom 2