Vajad kellegagi rääkida?
Küsi julgelt abi LasteAbi
Logi sisse

Järjestuste võrdlemine, otsingud andmebaasidest (BLAST, FASTA, SW). (0)

5 VÄGA HEA
Punktid

Esitatud küsimused

  • Mis piirkond on märgitud umbes 500 aminohappe juures?
  • Milline neist on seotud glükolüüsiga?
  • Millised mutatsioonid on tõenäoliselt toimunud valgus?

Bioinformaatika ülesanded

Järjestuste võrdlemine, otsingud andmebaasidest ( BLAST , FASTA , SW).


  • BLAST programmide kasutamine tundmatu valgujärjestuse identifitseerimiseks või sarnaste valgujärjestuste leidmiseks ( http://www.ncbi.nlm.nih.gov/BLAST/ ). Programmide kasutamisel tutvuda tutorialite ja juhenditega!!! ( http://www.ncbi.nlm.nih.gov/Education/BLASTinfo/information3.html ).
  • Otsida sarnaseid järjestusi antud valgujärjestusele. Valida sobiv programm vastavalt NCBI juhendile valgujärjestuse võrdlemiseks valgujärjestuste seast. Valida otsimiseks Refseq andmebaas , sooritada otsing, tulemuste formaat 500 joondamise jaoks.
    GTESPLLTDPSTPNFFWLAWQARDFMSKKYGQPVPDRAVSLAINSRTGRTQNHFHIHISCIRPDVRKQLDNNLANISSRWLPLPGGLRGHEYLARRVTESELVQRSPFMMLAEEVPEAREHMGRYGLAMVRQSDNSFVLLATQRNLLTLNRASAEEIQDHQCEILRMRHPLVMGNWKLNGSRHMVHELVSNLRKELAGVAGCAVAIAPPEMYIDMAKREAEGSHIMLGAQNVDLNLSGAFTGETSAAMLKDIGAQYIIIGHSERRTYHKESDELIAKKFAVLKEQGLTPVLCIGETEAENEAGKTEEVCARQIDAVLKTQGAAAFEGAVIAYEPVWAIGTGKSATPAQAQAVHKFIRDHIAKVDANIAEQVIIQYGGSVNASNAAELFAQPDIDGALVGGASLKADAFAVIVKAAEAAKQAMKPGCTLFFLLCSALTVTTEAHAQTPDTATTAPYLLAGAPTFDLSISQFREDFNSQNPSLPLNEFRAIDSSPDKANLTRAASKINENLYASTALERGTLKIKSIQMTWLPIQGPEQKAAKAKAQEYMAAVIRTLTPLMTKTQSQKKLQSLLTAGKNKRYYTETEGALRYVVADNGEKGLTFAVEPIKLALSESLEGLNKMTIQQWLFSFKGRIGRRDFWIWIGLWFAGMLVLFSLAGKNLLDIQTAAFCLVCLLWPTAAVTVKRLHDRGRSGAWAFLM
    VASTUS:
    Kasutasin programmi Protein -protein BLAST (blastp)
    Format – alignments 500
    Sarnased järjestused
    Database: NCBI Protein Reference Sequences
    Posted date : Apr 9, 2006 5:23 AM
    Number of letters in database: 811,773,583
    Number of sequences in database: 2,250,671
    Lambda K H
    0.319 0.133 0.393
    Gapped
    Lambda K H
    0.267 0.0410 0.140
    Matrix : BLOSUM62
    Gap Penalties: Existence: 11, Extension: 1
    Number of Sequences: 2250671
    Number of Hits to DB: 127332226
    Number of extensions: 4937094
    Number of successful extensions: 13884
    Number of sequences better than 10: 117
    Number of HSP's better than 10 without gapping: 0
    Number of HSP's gapped: 13724
    Number of HSP's successfully gapped: 117
    Length of query: 699
    Length of database: 811773583
    Length adjustment: 134
    Effective length of query: 565
    Effective length of database: 811773583
    Effective search space : 458652074395
    Effective search space used: 288253772985
    T: 11
    A: 40
    X1: 16 (7.4 bits )
    X2: 38 (14.6 bits)
    X3: 64 (24.7 bits)
    S1: 41 (20.4 bits)
    S2: 79 (35.0 bits)
  • Uurida leitud oletatavaid konserveerunud domeene, millistes vahemikes asetsevad? Mis piirkond on märgitud umbes 500 aminohappe juures? Millised on tõenäoliselt uuritavad valgud ja miks?
    VASTUS:
    Konserveerunud domeenid
    500 aminohape juures on valgu piirkond mis, ei sarnane mitte ühtegi valguga.
    Uuritavad valgud on TIM, Triosephosphate isomerase, CDP-diacylglycerol pyrophosphatase, TpiA , Triosephosphate isomerase, selle pärast, et nendel on kõige suurem skoor .
  • Kirjeldada lühidalt leitud valkude funktsioone (NCBI lingid , võib otsida infot ka teistest andmebaasidest), milline neist on seotud glükolüüsiga?
    VASTUS:
    Leitud valkude kirjeldused (lingid):
    pfam00121, TIM, Triosephosphate isomerase
    http://www.sanger.ac.uk/cgi-bin/Pfam/getacc?PF00121
    COG0149, TpiA, Triosephosphate isomerase [Carbohydrate transport and metabolism ]
    http://www.ncbi.nlm.nih.gov/entrez/query.fcgi?db=Pubmed&term=6759603,2204418,9133595,1588965,7217001,2263469
    pfam02611, CDH, CDP-diacylglycerol pyrophosphatase
    http://www.sanger.ac.uk/cgi-bin/Pfam/getacc?PF02611
    COG3152, COG3152, Predicted membrane protein [ Function unknown]
    http://www.ncbi.nlm.nih.gov/entrez/query.fcgi?dopt=cdd_protein&db=cdd&cmd=Display&from_uid=32966
    pfam05656, DUF805, Protein of unknown function (DUF805)
    http://www.sanger.ac.uk/cgi-bin/Pfam/getacc?PF05656
    Glükolüüsiga on seotud COG0149, TpiA, Triosephosphate isomerase [Carbohydrate transport and metabolism].
  • Kas võrdlemisel leiti kõikide valkude jaoks identne vastavus, kui mitte – milline on kõige sarnasem järjestus. Kirjeldada lühidalt.
    VASTUS:
    Identne 100%line vastavus on valkudel:
    Tõenäoliselt on identne selle glükolüüsi raja ensüümi ja võrreldava valgu järjestus Shigella ja Escherichia coli omadega
    ref|ZP_00696824.1| COG0149: Triosephosphate isomerase [Shigella boydii BS512]
    ref|ZP_00711366.1| COG0149: Triosephosphate isomerase [Escherichia coli B171]
    ref|ZP_00716926.1| COG0149: Triosephosphate isomerase [Escherichia coli B7A]
    ref|ZP_00722361.1| COG0149: Triosephosphate isomerase [Escherichia coli E110019]
    ref|ZP_00724252.1| COG0149: Triosephosphate isomerase [Escherichia coli F11]
    ref|ZP_00729559.1| COG0149: Triosephosphate isomerase [Escherichia coli E22]
    ref|ZP_00736248.1| COG0149: Triosephosphate isomerase [Escherichia coli 53638]
    ref|ZP_00921264.1| COG0149: Triosephosphate isomerase [Shigella dysenteriae 1012]
    ref|ZP_00924873.1| COG0149: Triosephosphate isomerase [Escherichia coli 101-1]
    Length=249
    96% sarnasus esines:
    Järelikult Salmonella vastava valgu järjestus pole täpselt identne võrreldud järjestusega, kuid on väga sarnane.
    ref|YP_153001.1|
    triosephosphate isomerase [Salmonella enterica subsp. enterica
    serovar Paratyphi A str. ATCC 9150]
    ref|YP_001591179.1|
    hypothetical protein SPAB_05055 [Salmonella enterica subsp. enterica
    serovar Paratyphi B str. SPB7]
    ref|ZP_02349944.1| hypothetical protein Sententeri_08764 [Salmonella enterica subsp.
    enterica serovar Dublin str. CT_02021853]
    ref|ZP_02652409.1| hypothetical protein Sententeric_15496 [Salmonella enterica subsp.
    enterica serovar Javiana str. GA_MM04042433]
    ref|ZP_02701262.1| hypothetical protein Saentericaenterica_24714 [Salmonella enterica
    subsp. enterica serovar Newport str. SL317 ]
    ref|ZP_02833567.1| hypothetical protein Salentericaenterica_19432 [Salmonella enterica
    subsp. enterica serovar Weltevreden str. HI_N05-537]
    Length=255
    Järgnevatel valkudel oli vastavus juba madalam, kuna tegemist on erinevate organismidega .
  • Uurida taksonoomia raportit iga valgu jaoks eraldi (vajaduse korral analüüsida järjestust mitmes osas) – leida kõige sarnasemad järjestused järgmistele taksonoomilistele rühmadele. Märkida ära skoor, E väärtus, liik (juhul, kui tulemusi ei leita, muuta otsingu parameetreid – NCBI juhendid).
  • Viirused
    Vastus:
    gi|39163649|ref|NP_945128.1|
    replicase [Johnsongrass chlorotic stripe mosaic virus ] 31.6 11
  • Archaea
    Vastus:
    gi|118753375|ref|ZP_01601187.1|
    Triose - phosphate isomerase [Metallosphaera sedula DSM 5348] 55.1 3e-07
  • Bacteria
    Vastus:
    gi|15804508|ref|NP_290548.1|
    triosephosphate isomerase [Escherichia coli O157:H7 EDL933] 498 2e-139
  • Fungi
    Vastus:
    gi|50424135|ref|XP_460653.1|
    hypothetical protein DEHA0F07436g [Debaryomyces hansenii CBS767] 209 5e-53
  • Protozoa
    Vastus:
    gi|71662494|ref|XP_818253.1|
    triosephosphate isomerase [Trypanosoma cruzi strain CL Brener] 187 2e-47
  • Taimed
    Vastus:
    gi|1351271|sp|P48496|TPIC_SPIOL
    Triosephosphate isomerase, chloroplast precursor (TIM) (Triose-phosphate isomerase) 211 9e-54
  • Selgroogsed
    Vastus:
    gi|6678413|ref|NP_033441.1|
    triosephosphate isomerase 1 [Mus musculus ] 195 2e-48
  • Putukad
    Vastus:
    gi|22090453|emb|CAD43178.1|
    triosephosphate isomerase [Tenebrio molitor] 213 2e-54
  • Kalad
    Vastus:
    gi|62125774|gb|AAX63800.1|
    NADH dehydrogenase subunit 5 [Myxocyprinus asiaticus] 23.9 2.3
  • Linnud
    Vastus:
    gi|45382061|ref|NP_990782.1|
    triosephosphate isomerase 1 [Gallus gallus] 192 9e-49
  • Imetajad
    Vastus:
    gi|6678413|ref|NP_033441.1|
    triosephosphate isomerase 1 [Mus musculus] 195 2e-48
  • Primaadid
    Vastus:
    gi|83674984|gb|ABC40672.1|
    rcTPI1 [ Gorilla gorilla] 192 4e-48
  • Võrrelda erinevatele valkudele leitud liikide identsustasemeid (%). Milline grupp on selle põhjal kõige lähedasem ja milline kõige kaugem sugulane leitud järjestusele.
    VASTUS:
    Kõige lähedasem on:
    Bacteria
    triosephosphate isomerase
    [Escherichia coli O157:H7 EDL933]
    Score = 520 bits (1338), Expect = 1e-145
    Identities = 255/255 (100%)
    Kõige kaugem on:
    Protozoa, keda üldse ei leitudki.
    Viirused
    hypothetical protein
    [Ostreococcus virus OsV5]
    Score = 32.7 bits (73), Expect = 5.8,
    Identities = 16/46 (34%)
  • BLAST programmi kasutamine valgumotiivide otsimisel.
  • Valida sobiv programm sarnasuste leidmiseks motiivile VEHINKTIAPALVSK ning valida otsimiseks andmebaas , mis sisaldab kõik GenBank CDS translatsioone + PDB + SwissProt + PIR + PRF. Sooritada otsing standardparameetritega, joondamiste arv 500.
    Database: All non- redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Mar 25, 2008 5:58 PM
    Number of letters in database: -2,129,407,321
    Number of sequences in database: 6,344,481
    Lambda K H
    0.343 0.282 1.59
    Gapped
    Lambda K H
    0.294 0.110 0.610
    Matrix: PAM30
    Gap Penalties: Existence: 9, Extension: 1
    Number of Sequences: 6344481
    Number of Hits to DB: 12186341
    Number of extensions: 227775
    Number of successful extensions: 10959
    Number of sequences better than 200000: 10715
    Number of HSP's better than 200000 without gapping: 0
    Number of HSP's gapped: 10957
    Number of HSP's successfully gapped: 10957
    Length of query: 15
    Length of database: 2165559971
    Length adjustment: 5
    Effective length of query: 10
    Effective length of database: 2133837566
    Effective search space: 21338375660
    Effective search space used: 21338375660
    T: 11
    A: 40
    X1: 15 (7.4 bits)
    X2: 35 (14.8 bits)
    X3: 58 (24.6 bits)
    S1: 32 (16.8 bits)
    S2: 32 (16.8 bits)
  • Uurida leitud sarnaseid järjestusi. Millised valgutüübid on esindatud , millised funktsioonid. Kas saab oletada midagi antud motiivi funktsiooni kohta valkudes või on tegemist juhuslikku kokkulangevusega.
    Valgutüübid:
    enolase 1, alpha non- neuron [Mus musculus]E=3e-05, Score=49.4
    võib oletada, et antud valgu järjestus omab antud organismi jaoks ka bioloogilist funktsiooni, kuna e väärtus on piisavalt väike ning kokkulangevus ei olnud juhuslik.
    Järgnevad kaks tulemust arvatavasti ei oma antud organismide jaoks bioloogilist funktsiooni, kuna e-väärtused on juba liiga suured ning kokkulangevus oli juhuslik.
    phosphopyruvate hydratase E=3.6 Score=32.5
    2-phospho-D-glycerate hydrolase [Nereis macrydi] E=6.5 Score=31.6
  • Võrdle antud programmi standardparameetrite ( filtrid , expect, sõna pikkus, maatriksi tüüp, tühiku skoorid) väärtuseid eelmises ülesandes kasutatud programmi standardparameetrite väärtustega. Kasutades juhendeid, tutoriale, abidokumente jne, selgitada nende väärtuste erinevuste põhjused – miks on teatud väärtused sobivad täieliku pikkusega valgujärjestuste jaoks ja miks teatud väärtused motiivide otsingutel.
    Parameetrid
    Short sequence program
    Protein-protein BLAST (blastp)
    Filter
    Ei ole filtrit
    Low- complexity
    Expect
    20000
    10
    Word size
    2
    3
    Matrix type
    Pam30
    Blosum62
    Gap penalty ( cost )
    Existance 9, extension 1
    Existance 11, extension 1
    Expect
    madalamad väärtused kitsendavad otsingut
    Filtrid- Also known as Masking. The process of hiding regions of (nucleic acid or amino acid) sequence having characteristics that frequently lead to spurious high scores.
    Expect- Expectation value . The number of different alignents with scores equivalent to or better than S that are expected to occur in a database search by chance . The lower the E value, the more significant the score.
    Sõna pikkus- algne järjestuse pikkus, mis dot-ploti põhimõttega lõigatakse 3 nukleotiid pikkusteks juppideks ja hakatakse sobitama võrreldava andmepanga järjestusega.
    Maatriksi tüüp-
    Substitution Matrix
    A substitution matrix containing values proportional to the probability that amino acid i mutates into amino acid j for all pairs of amino acids. such matrices are constructed by assembling a large and diverse sample of verified pairwise alignments of amino acids. If the sample is large enough to be statistically significant, the resulting matrices should reflect the true probabilities of mutations occurring through a period of evolution .
    Unitary Matrix
    Also known as Identity Matrix. A scoring system in which only identical characters receive a positive score.
    Tühiku skoorid-
    Calculating alignment scores. The raw score S for an alignment is calculated by summing the scores for each aligned position and the scores for gaps. In this figure , a DNA alignment is shown. In amino acid alignments, the score for an identity or a substitution is given by the specified substitution matrix (e.g. BLOSUM62). BLAST 2.0 and PSI-BLAST use "affine gap costs " which charge the score -a for the existence of a gap, and the score -b for each residue in the gap. A gap of k residues therefore receives a total score of -(a+bk) and a gap of length 1 receives the score -(a+b). Gap creation and extension variables a and b are inherent to the scoring system in use (BLAST 2.0 defaults).
    Gap:
    A space introduced into an alignment to compensate for insertions and deletions in one sequence relative to another . To prevent the accumulation of too many gaps in an alignment, introduction of a gap causes the deduction of a fixed amount (the gap score) from the alignment score. Extension of the gap to encompass additional nucleotides or amino acid is also penalized in the scoring of an alignment.
  • Varieerida parameetreid ükshaaval, selgitada nende mõju tulemustele:
    Mõju avaldas parameetrite muutmine vaid skoorile, expect ei muutunud.
  • Leida skoor ja E järjestuse gi|21325986|gb|AAM47554.1| jaoks järgmistel parameetrite kombinatsioonidel:
    >gi|21325986|gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    MSVLKVHAREIFDSRGNPTVEVDLYTNKGLFRAAVPSGASTGIYEALELRDNDKTRFMGKGVSKAVEHVN
    KTIAPALISKNINVVEQEKIDRLMLEMDGSENKSKFGANAILGVSLAVCKAGAAEKGVPLYRHIADLAGN
    SEVILPVPAFNVINGGSHAGNKLAMQEFMILPVGAESFKEAMRIGAEVYHNLKNVIKEKYGKDATNVGDE
    GGFAPNILENKEALELLKNAINKAGYSDKIVIGMDVAASEFYRDGKYDLDFKSPDDPSRYITHDQLGDLY
    KSFVKNYPVVSIEDPFDQDDWAAWKKFTACVDIQVVGDDLTVTNPKRIAKAVDEKACNCLLLKVNQIGSV
    TESLQACKLAQSNGWGVMVSHRSGETEDTFIADLVVGLCTGQIKTGAPCRSERLAKYNQILRIEEELGSK
    ARFAGRNFRNPRIN
  • default sõna pikkus, skoorimaatriks, tühiku trahv .
  • sõna = 3, PAM30, gap 9/1
    Database: All non-redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Apr 1, 2008 5:55 PM
    Number of letters in database: -2,114,121,490
    Number of sequences in database: 6,388,671
    Lambda K H
    0.340 0.284 1.71
    Gapped
    Lambda K H
    0.294 0.110 0.610
    Matrix: PAM30
    Gap Penalties: Existence: 9, Extension: 1
    Number of Sequences: 6388671
    Number of Hits to DB: 292755462
    Number of extensions: 22749798
    Number of successful extensions: 23183
    Number of sequences better than 100: 110
    Number of HSP's better than 100 without gapping: 0
    Number of HSP's gapped: 22470
    Number of HSP's successfully gapped: 157
    Length of query: 434
    Length of database: 2180845802
    Length adjustment: 35
    Effective length of query: 399
    Effective length of database: 1957242317
    Effective search space: 780939684483
    Effective search space used: 780939684483
    T: 11
    A: 40
    X1: 15 (7.3 bits)
    X2: 35 (14.8 bits)
    X3: 58 (24.6 bits)
    S1: 41 (20.6 bits)
    S2: 70 (32.9 bits)
    gb|AAM47551.1|AF428105_1 tau-crystallin protein [Crocodylus palustris]
    gb|AAM47552.1|AF428106_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47553.1|AF428107_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    Length=434
    Score = 927 bits (2180), Expect = 0.0, Method : Compositional matrix adjust .
    Identities = 434/434 (100%), Positives = 434/434 (100%), Gaps = 0/434 (0%)
  • sõna = 3, PAM30, gap 5/2
    Database: All non-redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Apr 1, 2008 5:55 PM
    Number of letters in database: -2,114,121,490
    Number of sequences in database: 6,388,671
    Lambda K H
    0.340 0.284 1.71
    Gapped
    Lambda K H
    0.264 0.0790 0.450
    Matrix: PAM30
    Gap Penalties: Existence: 5, Extension: 2
    Number of Sequences: 6388671
    Number of Hits to DB: 293554133
    Number of extensions: 23161675
    Number of successful extensions: 24748
    Number of sequences better than 100: 147
    Number of HSP's better than 100 without gapping: 0
    Number of HSP's gapped: 23526
    Number of HSP's successfully gapped: 161
    Length of query: 434
    Length of database: 2180845802
    Length adjustment: 48
    Effective length of query: 386
    Effective length of database: 1874189594
    Effective search space: 723437183284
    Effective search space used: 723437183284
    T: 11
    A: 40
    X1: 15 (7.3 bits)
    X2: 39 (14.9 bits)
    X3: 65 (24.8 bits)
    S1: 41 (19.3 bits)
    S2: 77 (33.0 bits)
    gb|AAM47551.1|AF428105_1 tau-crystallin protein [Crocodylus palustris]
    gb|AAM47552.1|AF428106_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47553.1|AF428107_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    Length=434
    Score = 833 bits (2180), Expect = 0.0, Method: Compositional matrix adjust.
    Identities = 434/434 (100%), Positives = 434/434 (100%), Gaps = 0/434 (0%)
  • sõna = 2, PAM70, gap 11/1
    gb|AAM47551.1|AF428105_1 tau-crystallin protein [Crocodylus palustris]
    gb|AAM47552.1|AF428106_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47553.1|AF428107_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    Length=434
    Score = 944 bits (2140), Expect = 0.0, Method: Compositional matrix adjust.
    Identities = 434/434 (100%), Positives = 434/434 (100%), Gaps = 0/434 (0%)
    Database: All non-redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Apr 1, 2008 5:55 PM
    Number of letters in database: -2,114,121,490
    Number of sequences in database: 6,388,671
    Lambda K H
    0.335 0.230 0.994
    Gapped
    Lambda K H
    0.305 0.120 0.520
    Matrix: PAM70
    Gap Penalties: Existence: 11, Extension: 1
    Number of Sequences: 6388671
    Number of Hits to DB: 319190275
    Number of extensions: 36075087
    Number of successful extensions: 18810
    Number of sequences better than 100: 120
    Number of HSP's better than 100 without gapping: 0
    Number of HSP's gapped: 18220
    Number of HSP's successfully gapped: 133
    Length of query: 434
    Length of database: 2180845802
    Length adjustment: 42
    Effective length of query: 392
    Effective length of database: 1912521620
    Effective search space: 749708475040
    Effective search space used: 749708475040
    T: 11
    A: 40
    X1: 15 (7.3 bits)
    X2: 34 (15.0 bits)
    X3: 56 (24.6 bits)
    S1: 41 (21.1 bits)
    S2: 68 (33.0 bits)
  • sõna = 2, PAM70, gap 6/2
    gb|AAM47551.1|AF428105_1 tau-crystallin protein [Crocodylus palustris]
    gb|AAM47552.1|AF428106_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47553.1|AF428107_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    Length=434
    Score = 819 bits (2140), Expect = 0.0, Method: Compositional matrix adjust.
    Identities = 434/434 (100%), Positives = 434/434 (100%), Gaps = 0/434 (0%)
    Database: All non-redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Apr 1, 2008 5:55 PM
    Number of letters in database: -2,114,121,490
    Number of sequences in database: 6,388,671
    Lambda K H
    0.335 0.230 0.994
    Gapped
    Lambda K H
    0.264 0.0640 0.290
    Matrix: PAM70
    Gap Penalties: Existence: 6, Extension: 2
    Number of Sequences: 6388671
    Number of Hits to DB: 319190275
    Number of extensions: 36075087
    Number of successful extensions: 18810
    Number of sequences better than 100: 123
    Number of HSP's better than 100 without gapping: 0
    Number of HSP's gapped: 18211
    Number of HSP's successfully gapped: 127
    Length of query: 434
    Length of database: 2180845802
    Length adjustment: 71
    Effective length of query: 363
    Effective length of database: 1727250161
    Effective search space: 626991808443
    Effective search space used: 626991808443
    T: 11
    A: 40
    X1: 15 (7.3 bits)
    X2: 39 (14.9 bits)
    X3: 65 (24.8 bits)
    S1: 41 (19.6 bits)
    S2: 76 (32.9 bits)
  • sõna = 2, BLOSUM80, gap 10/1
    gb|AAM47551.1|AF428105_1 tau-crystallin protein [Crocodylus palustris]
    gb|AAM47552.1|AF428106_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47553.1|AF428107_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    Length=434
    Score = 934 bits (2158), Expect = 0.0, Method: Compositional matrix adjust.
    Identities = 434/434 (100%), Positives = 434/434 (100%), Gaps = 0/434 (0%)
    Database: All non-redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Apr 1, 2008 5:55 PM
    Number of letters in database: -2,114,121,490
    Number of sequences in database: 6,388,671
    Lambda K H
    0.346 0.180 0.644
    Gapped
    Lambda K H
    0.299 0.0710 0.270
    Matrix: BLOSUM80
    Gap Penalties: Existence: 10, Extension: 1
    Number of Sequences: 6388671
    Number of Hits to DB: 342647358
    Number of extensions: 35058157
    Number of successful extensions: 19113
    Number of sequences better than 100: 288
    Number of HSP's better than 100 without gapping: 0
    Number of HSP's gapped: 18519
    Number of HSP's successfully gapped: 299
    Length of query: 434
    Length of database: 2180845802
    Length adjustment: 76
    Effective length of query: 358
    Effective length of database: 1695306806
    Effective search space: 606919836548
    Effective search space used: 606919836548
    T: 11
    A: 40
    X1: 15 (7.5 bits)
    X2: 34 (14.7 bits)
    X3: 57 (24.6 bits)
    S1: 39 (20.6 bits)
    S2: 67 (32.7 bits)
  • sõna = 2, BLOSUM45, gap 15/2
    gb|AAM47551.1|AF428105_1 tau-crystallin protein [Crocodylus palustris]
    gb|AAM47552.1|AF428106_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47553.1|AF428107_1 alpha-enolase [Crocodylus palustris]
    gb|AAM47554.1|AF428108_1 alpha-enolase [Crocodylus palustris]
    Length=434
    Score = 938 bits (3189), Expect = 0.0, Method: Compositional matrix adjust.
    Identities = 434/434 (100%), Positives = 434/434 (100%), Gaps = 0/434 (0%)
    Database: All non-redundant GenBank CDS translations+PDB+SwissProt+PIR+PRF excluding
    environmental samples from WGS projects
    Posted date: Apr 1, 2008 5:55 PM
    Number of letters in database: -2,114,121,490
    Number of sequences in database: 6,388,671
    Lambda K H
    0.231 0.0939 0.243
    Gapped
    Lambda K H
    0.203 0.0410 0.120
    Matrix: BLOSUM45
    Gap Penalties: Existence: 15, Extension: 2
    Number of Sequences: 6388671
    Number of Hits to DB: 413908549
    Number of extensions: 45854299
    Number of successful extensions: 22765
    Number of sequences better than 100: 190
    Number of HSP's better than 100 without gapping: 0
    Number of HSP's gapped: 21810
    Number of HSP's successfully gapped: 190
    Length of query: 434
    Length of database: 2180845802
    Length adjustment: 163
    Effective length of query: 271
    Effective length of database: 1139492429
    Effective search space: 308802448259
    Effective search space used: 308802448259
    T: 11
    A: 40
    X1: 22 (7.3 bits)
    X2: 51 (14.9 bits)
    X3: 85 (24.9 bits)
    S1: 55 (20.7 bits)
    S2: 92 (31.6 bits)
  • Expect väärtus – mis see on, mida ja kuidas mõjutab varieerimine, milline on minimaalne väärtus, kui otsing annab veel tulemusi.
    Suur e-väärtus näitab tõenäosust, et selline sarnasus tekkis juhuslikult uuritava valgu ja andmepangas oleva valgu järjestuse vahel. E-väärtuse alusel saab hinnata tekkinud sarnasuse juhuslikkust. Kui e-väärtus on väike, siis on sarnasus mittejuhuslik ja järjestusel on bioloogiline tähendus.
    Minimaalne expecti väärtus on 10, mis on ühtlasi ette antud.
  • Sõna pikkus – mis asi see on, mida ja kuidas mõjutab varieerimine.
    Otsingul meie sisestatud järjestus jagatakse juppideks. Sõna pikkus näitab jupi pikkust, siis leitakse need jupid, mis vastavad andmebaasi omadega, seejärel pikendatakse antud järjestust. Mida pikem sõna järjestus, seda vähem leitakse tulemusi, kuid tulemus on spetsiifilisem ja e-väärtus on väikesem.
    Word-size
    BLAST is a heuristic that works by finding word-matches between the query and database sequences. One may think of this process as finding "hot-spots" that BLAST can then use to initiate extensions that might eventually lead to full -blown alignments. For nucleotide-nucleotide searches (i.e., "blastn") an exact match of the entire word is required before an extension is initiated, so that one normally regulates the sensitivity and speed of the search by increasing or decreasing the word-size. For other BLAST searches non-exact word matches are taken into account based upon the similarity between words . The amount of similarity can be varied so one normally uses just the word-sizes 2 and 3 for these searches.
  • Skoorimaatriksite varieerimine – kuidas mõjutab varieerimine.
    Skoori number sõltub kõige rohkem maatriksist, sõltuvalt ülesandest valitakse sobiv skoorimaatriks.
    Matrix
    A key element in evaluating the quality of a pairwise sequence alignment is the "substitution matrix", which assigns a score for aligning any possible pair of residues. The matrix used in a BLAST search can be changed depending on the type of sequences you are searching with (see the BLAST Frequently Asked Questions ). See more information on BLAST substitution matrices.
  • Tühiku hinded – kuidas mõjutab varieerimine.
    Mida suurem on tühiku hinne, seda vähem on otsitavas joondamises tühikuid.
    Gap Cost
    The pull down menu shows the Gap Costs for the chosen Matrix. There can only be a limited number of options for these parameters. Increasing the Gap Costs will result in alignments which decrease the number of Gaps introduced.
  • Tundmatu vigase genoomse DNA järjestuse identifitseerimine BLAST-i abil, vajadusel varieerides parameetreid.
  • Identifitseerida järjestus otsinguga nukleotiidide andmebaasist.
    http://www.ncbi.nlm.nih.gov/entrez/viewer.fcgi?cmd=Retrieve&db=Nucleotide&list_uids=169887498&dopt=GenBank&WebEnv=08JvAS8kBlinjBrUEMjwnEGJY7QsTje9ctJtS_O29kHa_vVcySL_SQi5eaFRYLaT9Shy2Dl4R1IHFhx%40D45A42847E9DBF30_0786SID&WebEnvRq=1
    b.Identifitseerida valgud kasutades DNA transleerimist kõigis 6-s raamis ning otsingut valkude andmebaasist.
    pdb|2J0X|B
    Chain B, Crystal Structure Of E. Coli Aspartokinase Iii In Complex
    With Lysine And Aspartate (T-State)
    Length=446
    Score = 268 bits (685), Expect = 7e-70
    Identities = 179/184 (97%), Positives = 182/184 (98%), Gaps = 1/184 (0%)
    Frame = -3
    Query 1339 SAGITNLLVALAEGLEPGERFEKLDAIRNIQFAILERLRYPNVireeierllENItvlae 1160
    SAGITNLLVALAEGLEPGERFEKLDAIRNIQFAILERLRYPNVIREEIERLLENITVLAE
    Sbjct 40 SAGITNLLVALAEGLEPGERFEKLDAIRNIQFAILERLRYPNVIREEIERLLENITVLAE 99
    Query 1159 aaalatspalTDELVSHGELMSTLLFVEILRERDVQAQWFDVRKVMRTNDRFGRAEPDIa 980
    AAALATSPALTDELVSHGELMSTLLFVEILRERDVQAQWFDVRKVMRTNDRFGRAEPDIA
    Sbjct 100 AAALATSPALTDELVSHGELMSTLLFVEILRERDVQAQWFDVRKVMRTNDRFGRAEPDIA 159
    Query 979 alaelaalqlLPRLNEGLVITQGFIGSENKGRTTTLGRGGSDYTAALLAEALHASRV-VW 803
    ALAELAALQLLPRLNEGLVITQGFIGSENKGRTTTLGRGGSDYTAALLAEALHASRV +W
    Sbjct 160 ALAELAALQLLPRLNEGLVITQGFIGSENKGRTTTLGRGGSDYTAALLAEALHASRVDIW 219
    Query 802 SNPP 791
    ++ P
    Sbjct 220 TDVP 223
    Score = 73.2 bits (178), Expect = 4e-11
    Identities = 38/38 (100%), Positives = 38/38 (100%), Gaps = 0/38 (0%)
    Frame = -3
    Query 115 SEIVVSKFGGTSVADFDAMNRSADIVLSDANVRLVVLS 2
    SEIVVSKFGGTSVADFDAMNRSADIVLSDANVRLVVLS
    Sbjct 1 SEIVVSKFGGTSVADFDAMNRSADIVLSDANVRLVVLS 38
    Coli järjestused on kõige sarnasemad, kuid sarnane järjestus leiti ka näiteks järgnevates organismides:
    Shigella
    Salmonella
    Klebsiella
    c.Identifitseerida valgud kasutades DNA transleerimist kõigis 6-s raamis ning otsingut transleeritud järjestuste andmebaasist.
    gb|CP000948.1|
    Escherichia coli DH10B, complete genome
    Length=4686137
    Features in this part of subject sequence:
    aspartokinase III
    glucosephosphate isomerase
    Score = 647 bits (1406), Expect = 0.0
    Identities = 268/268 (100%), Positives = 268/268 (100%), Gaps = 0/268 (0%)
    Frame = +2/+3
    Query 2 REDN*THVGIRKHNISAAVHGVKISYAGTAKFGDNNFRHNYLVSGDPFSALAQGKSGRRV 181
    REDN*THVGIRKHNISAAVHGVKISYAGTAKFGDNNFRHNYLVSGDPFSALAQGKSGRRV
    Sbjct 4330836 REDN*THVGIRKHNISAAVHGVKISYAGTAKFGDNNFRHNYLVSGDPFSALAQGKSGRRV 4331015
    Query 182 GAERYFATIFTQKCSTTCETPDCERFW*QPRGFSPCSR**TWPAVQSPRRCTPSGVITGL 361
    GAERYFATIFTQKCSTTCETPDCERFW*QPRGFSPCSR**TWPAVQSPRRCTPSGVITGL
    Sbjct 4331016 GAERYFATIFTQKCSTTCETPDCERFW*QPRGFSPCSR**TWPAVQSPRRCTPSGVITGL 4331195
    Query 362 APPTPLLGQRASSGLR*RR*YIYK*RVSGAVVNDGVMRIFHPLLAVSSSANKCFTALRVY 541
    APPTPLLGQRASSGLR*RR*YIYK*RVSGAVVNDGVMRIFHPLLAVSSSANKCFTALRVY
    Sbjct 4331196 APPTPLLGQRASSGLR*RR*YIYK*RVSGAVVNDGVMRIFHPLLAVSSSANKCFTALRVY 4331375
    Query 542 TQHYANGTKTITFFCDWRYNLPKSQFSKSEEYC**KTSIQRRPLPGRHYRNTSMK*KTLR 721
    TQHYANGTKTITFFCDWRYNLPKSQFSKSEEYC**KTSIQRRPLPGRHYRNTSMK*KTLR
    Sbjct 4331376 TQHYANGTKTITFFCDWRYNLPKSQFSKSEEYC**KTSIQRRPLPGRHYRNTSMK*KTLR 4331555
    Query 722 SPIFLLKTAIVFLSSPQPSTIRCWWITP 805
    SPIFLLKTAIVFLSSPQPSTIRCWWITP
    Sbjct 4331556 SPIFLLKTAIVFLSSPQPSTIRCWWITP 4331639
    Features in this part of subject sequence:
    aspartokinase III
    glucosephosphate isomerase
    Score = 613 bits (1333), Expect = 1e-172
    Identities = 268/268 (100%), Positives = 268/268 (100%), Gaps = 0/268 (0%)
    Frame = -2/-3
    Query 806 LE*STSI*SSKVAENLEKRSPSLAKRSAIVTSFISSKCFCSACQAAVCVGLMFFISNTLL 627
    LE*STSI*SSKVAENLEKRSPSLAKRSAIVTSFISSKCFCSACQAAVCVGLMFFISNTLL
    Sbjct 4331640 LE*STSI*SSKVAENLEKRSPSLAKRSAIVTSFISSKCFCSACQAAVCVGLMFFISNTLL 4331461
    Query 626 ILRIVTLEDCSASHRKM*WF*CR*RNVECKPLAQ*SIY*LNY*PPGVDEKSA*PHR*QPP 447
    ILRIVTLEDCSASHRKM*WF*CR*RNVECKPLAQ*SIY*LNY*PPGVDEKSA*PHR*QPP
    Sbjct 4331460 ILRIVTLEDCSASHRKM*WF*CR*RNVECKPLAQ*SIY*LNY*PPGVDEKSA*PHR*QPP 4331281
    Query 446 RSPFIYKCTTCASAGQKRRVAQVTVLEEPVL**HLRGCIAEVIERLATFIIGYRG* IPWV 267
    RSPFIYKCTTCASAGQKRRVAQVTVLEEPVL**HLRGCIAEVIERLATFIIGYRG*IPWV
    Sbjct 4331280 RSPFIYKCTTCASAGQKRRVAQVTVLEEPVL**HLRGCIAEVIERLATFIIGYRG*IPWV 4331101
    Query 266 VTRSVRSRAFRKWWSTSG*K**RSIALRPPVFRSSLVPRLKMDPLTRGSYV*NCCLQIWR 87
    VTRSVRSRAFRKWWSTSG*K**RSIALRPPVFRSSLVPRLKMDPLTRGSYV*NCCLQIWR
    Sbjct 4331100 VTRSVRSRAFRKWWSTSG*K**RSIALRPPVFRSSLVPRLKMDPLTRGSYV*NCCLQIWR 4330921
    Query 86 YQRS*F*RHEPQR*YCAF*CQRAFSCPL 3
    YQRS*F*RHEPQR*YCAF*CQRAFSCPL
    Sbjct 4330920 YQRS*F*RHEPQR*YCAF*CQRAFSCPL 4330837
    Sarnaseid järjestusi leiti veel näiteks organismides:
    Shigella
    Klebsiella
    Enterobacter
    Yersinia pseudotuberculosis
  • Analüüsida tulemusi – mis liik, mis geenid ja valgud. Milline algoritm oli kõige tundlikum .
    Esimene meetod andis esimese tulemusena E. Coli aspartokinaasi III, teine meetod pakkus hohkem erinevaid variante, esimene valk oli E. Coli kas aspartokinase III või glucosephosphate isomerase.
    Ccgagaggacaactaaacgcacgttggcatcagaaagcacaatatcagcgctgcggttcatggcgtcaaaatcagctacgctggtaccgccaaatttggagacaacaatttcagacataactacctcgtgtcaggggatccattttcagccttggcacaagggaagagcggaagacgggtgggcgcagagcgatacttcgctactattttcacccagaagtgctccaccacttgcgaaacgcccgactgcgaacgcttctggtgacaacccaggggattcagcccctgtagccgatgatgaacgtggccagccgttcaatcacctcggcgatgcaccccctcaggtgttatcacaggactggctcctccaacaccgttacttgggcaacgcgcctcttctggcctgcgctagcgcaggtagtacatttataaataaagggtgagcggggcggttgtcaacgatggggtcatgcggatttttcatccactcctggcggtcagtagttcagctaataaatgcttcactgcgctaagggtttacactcaacattacgctaacggcactaaaaccatcacatttttctgtgactggcgctacaatcttccaaagtcacaattctcaaaatcagaagagtattgctaatgaaaaacatcaatccaacgcagaccgctgcctggcaggcactacagaaacacttcgatgaaatgaaagacgttacgatcgccgatctttttgctaaagacggcgatcgtttttctaagttctccgcaaccttcgacgatcagatgctggtggattactccaaacaacacgagatgcgtgtaaagcctccgccagcaaggctgccgtataatcgctgcctccacggccaagcgtcgttgtacgacctttattttcgctaccgataaatccctgggtgatcactaagccttcattgagacgtgggagcagctgcagcgcggccagttccgccagcgcggctatatctggctctgcacgaccaaatcggtcgttggtacgcatcactttacgtacatcaaaccactgtgcctgaacatcgcgttcgcgcaggatctcaacaaacagcagggtcgacatcagctcgccgtggctgaccagctcatctgtcagcgccggagacgttgccagcgccgccgcttctgccagaacagtaatgttctccagcagacgttcaatctcttcacggataacgttcgggtaacgcagacgttccagaatggcaaactggatgttgcggatagcgtcgagtttttcgaatcgctcgccaggttccagtccttcagctaaagcgaccagcagattagtgataccagcagaag
  • Erinevate otsingualgoritmide võrdlus, uuritava valgu ja selles toimunud mutatsioonide tuvastamine.
  • Kasutada otsingutel erinevaid „k-tuple” (BLAST - http://www.ncbi.nlm.nih.gov/BLAST/ , FASTA - http://www.ebi.ac.uk/Tools/similarity.html ) ja SW modifitseeritud algoritme (MPsrch ja Scanps - http://www.ebi.ac.uk/Tools/similarity.html ). Parema tulemuse saamiseks varieerida vajaduse korral parameetreid.
    RIGRIVFRAAQKRSDIEIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKKIRVTAERDPANLKWDEVGVDVVAEATGLNFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSHKDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVSVVDFRVPTPNVSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGEVCTSVFDAKAGIALNDNFVKLVSWYDNETGYSN
    Bottom of Form
  • Milline on uuritav valk, millised ortoloogid ja paraloogid leiti erinevatel otsingutel?
    . ortoloog – eri liikidest pärit järjestused, millel on üks ühine eellane
    4
    paraloog – samast liigist pärit järjestused, millel on üks ühine eellane
    Uuritav valk: Glyceraldehyde 3-phosphate
    E. Colide puhul esineb nii ortolooge kui paralooge.
    Näiteks paraloogid:
    >>UNIPROT:Q6WAN9_ECOLX Q6WAN9 Glyceraldehyde phosphate d (220 aa)
    initn: 1051 init1: 715 opt: 721 Z-score: 859.5 bits: 166.6 E(): 2.7e-39
    Smith-Waterman score: 1058; 75.8% identity (75.8% similar ) in 244 aa overlap (36-244:1-220)
    10 20 30 40 50 60
    Sequen VFRAAQKRSDIEIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKKIRVTA
    ::::::::::::::::::::::::::::::
    UNIPRO YDSTHGRFDGTVEVKDGHLIVNGKKIRVTA
    10 20 30
    70 80 90
    Sequen ERDPANLKWDEVGVDVVAEATGL-----------------------------------NF
    ::::::::::::::::::::::: ::
    UNIPRO ERDPANLKWDEVGVDVVAEATGLFLTDETARKHITAGAKKVVMTGPSKDNTPMFVKGANF
    40 50 60 70 80 90
    100 110 120 130 140 150
    Sequen DKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSHKDWRG
    ::::::::::::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO DKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSHKDWRG
    100 110 120 130 140 150
    160 170 180 190 200 210
    Sequen GRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVSVVDFR
    :::::::::::::::::::::::::::::::::::::::::::
    UNIPRO GRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVS-----------------
    160 170 180 190
    220 230 240 250 260 270
    Sequen VPTPNVSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGEVCTSV
    :::::::::::::::::::::::::::
    UNIPRO -------VVDLTVRLEKAATYEQIKAAVKAAAEG
    200 210 220
    280 290
    Sequen FDAKAGIALNDNFVKLVSWYDNETGYSN
    >>UNIPROT:Q9L704_ECOLX Q9L704 Glyceraldehyde-3-phosphate (221 aa)
    initn: 1199 init1: 715 opt: 721 Z-score: 859.4 bits: 166.6 E(): 2.7e-39
    Smith-Waterman score: 1067; 75.5% identity (75.5% similar) in 245 aa overlap (23-232:1-221)
    10 20 30 40 50 60
    Sequen RIGRIVFRAAQKRSDIEIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKK
    ::::::::::::::: ::::::::::::::::::::::
    UNIPRO DLLDADYMAYMLKYDFTHGRFDGTVEVKDGHLIVNGKK
    10 20 30
    70 80
    Sequen IRVTAERDPANLKWDEVGVDVVAEATGL--------------------------------
    ::::::::::::::::::::::::::::
    UNIPRO IRVTAERDPANLKWDEVGVDVVAEATGLFLTDETARKHITAGAKKVVMTGPSKDNTPMFV
    40 50 60 70 80 90
    90 100 110 120 130 140
    Sequen ---NFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSH
    :::::::::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO KGANFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSH
    100 110 120 130 140 150
    150 160 170 180 190 200
    Sequen KDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVS
    :::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO KDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVD---------
    160 170 180 190 200
    210 220 230 240 250 260
    Sequen VVDFRVPTPNVSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGE
    ::::::::::::
    UNIPRO ---------------LTVRLEKAATYE
    210 220
    >>UNIPROT:Q9K2R9_ECOLX Q9K2R9 Glyceraldehyde-3-phosphate (221 aa)
    initn: 1207 init1: 715 opt: 721 Z-score: 859.4 bits: 166.6 E(): 2.7e-39
    Smith-Waterman score: 1075; 75.9% identity (75.9% similar) in 245 aa overlap (23-232:1-221)
    10 20 30 40 50 60
    Sequen RIGRIVFRAAQKRSDIEIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKK
    ::::::::::::::::::::::::::::::::::::::
    UNIPRO DLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKK
    10 20 30
    70 80
    Sequen IRVTAERDPANLKWDEVGVDVVAEATGL--------------------------------
    ::::::::::::::::::::::::::::
    UNIPRO IRVTAERDPANLKWDEVGVDVVAEATGLFLTDETARKHITAGAKKVVMTGPSKDNTPMFV
    40 50 60 70 80 90
    90 100 110 120 130 140
    Sequen ---NFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSH
    :::::::::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO KGANFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSH
    100 110 120 130 140 150
    150 160 170 180 190 200
    Sequen KDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVS
    :::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO KDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVD---------
    160 170 180 190 200
    210 220 230 240 250 260
    Sequen VVDFRVPTPNVSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGE
    ::::::::::::
    UNIPRO ---------------LTVRLEKAATYE
    210 220
    >>UNIPROT:Q6WAP3_ECOLX Q6WAP3 Glyceraldehyde phosphate d (277 aa)
    initn: 1169 init1: 715 opt: 721 Z-score: 858.0 bits: 166.7 E(): 3.2e-39
    Smith-Waterman score: 1423; 80.4% identity (80.4% similar) in 301 aa overlap (17-282:1-277)
    10 20 30 40 50 60
    Sequen RIGRIVFRAAQKRSDIEIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKK
    ::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO EIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKK
    10 20 30 40
    70 80
    Sequen IRVTAERDPANLKWDEVGVDVVAEATGL--------------------------------
    ::::::::::::::::::::::::::::
    UNIPRO IRVTAERDPANLKWDEVGVDVVAEATGLFLTDETARKHITAGAKKVVMTGPSKDNTPMFV
    50 60 70 80 90 100
    90 100 110 120 130 140
    Sequen ---NFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSH
    :::::::::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO KGANFDKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSH
    110 120 130 140 150 160
    150 160 170 180 190 200
    Sequen KDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVS
    ::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO KDWRGGRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPN--------------
    170 180 190 200 210
    210 220 230 240 250 260
    Sequen VVDFRVPTPNVSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGE
    ::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO ----------VSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGE
    220 230 240 250 260
    270 280 290
    Sequen VCTSVFDAKAGIALNDNFVKLVSWYDNETGYSN
    :::::::::::::::::
    UNIPRO VCTSVFDAKAGIALNDN
    270
    Ortoloogid:
    >>UNIPROT:A8Q3K1_BRUMA A8Q3K1 Glyceraldehyde 3-phosphate (299 aa)
    initn: 770 init1: 693 opt: 790 Z-score: 939.2 bits: 181.8 E(): 9.6e-44
    Smith-Waterman score: 1073; 59.5% identity (78.7% similar) in 301 aa overlap (1-298:13-287)
    10 20 30 40
    Sequen RIGRIVFRAAQKRSDIEIVAIND-LLDADYMAYMLKYDSTHGRFDGTV
    ::::.:.::: ... ...::.:: ... :::.::.::::::::: :.:
    UNIPRO MSKPKVGINGFGRIGRLVLRAAVEKDTVDVVAVNDPFINIDYMVYMFKYDSTHGRFKGSV
    10 20 30 40 50 60
    50 60 70 80 90 100
    Sequen EVKDGHLIVNGKKIRVTAERDPANLKWDEVGVDVVAEATGLNFDKY--AGQDIVSNASCT
    .. :.:::.. . .. . .. . ..:. . :.: : : :.. :.::::::
    UNIPRO SAEGGKLIVTNASAHLKG--GAKKVIISAPSADAPMFVMGVNNDTYDKANNHIISNASCT
    70 80 90 100 110
    110 120 130 140 150 160
    Sequen TNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSHKDWRGGRGASQNIIPSSTGA
    :::::::::::.:.::::::::::::::::::::::::: : :: ::::.:::::.::::
    UNIPRO TNCLAPLAKVIHDKFGIIEGLMTTVHATTATQKTVDGPSGKLWRDGRGAGQNIIPASTGA
    120 130 140 150 160 170
    170 180 190 200 210 220
    Sequen AKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVSVVDFRVPTPNVSVVDLTVRL
    :::::::.:.:::::::::::::::.::::: :: ::
    UNIPRO AKAVGKVIPDLNGKLTGMAFRVPTPDVSVVD------------------------LTCRL
    180 190 200 210
    230 240 250 260 270 280
    Sequen EKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGEVCTSVFDAKAGIALNDNFVK
    .:.::...:::::: ::.: :::.: ::::.::::::.:.. .:.::: : :.:: ::::
    UNIPRO QKGATMDEIKAAVKEAANGPMKGILEYTEDQVVSTDFTGDTHSSIFDALACISLNPNFVK
    220 230 240 250 260 270
    290
    Sequen LVSWYDNETGYSN
    :..::::: ::::
    UNIPRO LIAWYDNEYGYSNRVVDLISYIASR
    280 290
    >>UNIPROT:Q6WAN9_ECOLX Q6WAN9 Glyceraldehyde phosphate d (220 aa)
    initn: 1051 init1: 715 opt: 721 Z-score: 859.5 bits: 166.6 E(): 2.7e-39
    Smith-Waterman score: 1058; 75.8% identity (75.8% similar) in 244 aa overlap (36-244:1-220)
    10 20 30 40 50 60
    Sequen VFRAAQKRSDIEIVAINDLLDADYMAYMLKYDSTHGRFDGTVEVKDGHLIVNGKKIRVTA
    ::::::::::::::::::::::::::::::
    UNIPRO YDSTHGRFDGTVEVKDGHLIVNGKKIRVTA
    10 20 30
    70 80 90
    Sequen ERDPANLKWDEVGVDVVAEATGL-----------------------------------NF
    ::::::::::::::::::::::: ::
    UNIPRO ERDPANLKWDEVGVDVVAEATGLFLTDETARKHITAGAKKVVMTGPSKDNTPMFVKGANF
    40 50 60 70 80 90
    100 110 120 130 140 150
    Sequen DKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSHKDWRG
    ::::::::::::::::::::::::::::::::::::::::::::::::::::::::::::
    UNIPRO DKYAGQDIVSNASCTTNCLAPLAKVINDNFGIIEGLMTTVHATTATQKTVDGPSHKDWRG
    100 110 120 130 140 150
    160 170 180 190 200 210
    Sequen GRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVSVVDFRVPTPNVSVVDFR
    :::::::::::::::::::::::::::::::::::::::::::
    UNIPRO GRGASQNIIPSSTGAAKAVGKVLPELNGKLTGMAFRVPTPNVS-----------------
    160 170 180 190
    220 230 240 250 260 270
    Sequen VPTPNVSVVDLTVRLEKAATYEQIKAAVKAAAEGEMKGVLGYTEDDVVSTDFNGEVCTSV
    :::::::::::::::::::::::::::
    UNIPRO -------VVDLTVRLEKAATYEQIKAAVKAAAEG
    200 210 220
    280 290
    Sequen FDAKAGIALNDNFVKLVSWYDNETGYSN
  • Millised mutatsioonid on tõenäoliselt toimunud valgus?
    Eelnevalt jooniselt on näha, et kohtades kus on kriips , siis on toimunud uniproga võrreldes deletsioon või insertsioon. Mõnes kohas on näha ka punktmutatsioon, siis on eelneval joonisel kahe punkti asemel üks punkt ahelate vahel.
  • Võrrelda erinevate programmide tulemusi lähtudes kasutatud parameetritest, kirjeldada lühidalt programmide erinevusi algoritmide seisukohalt. Milline oli sobivaim ?
    FASTA: http://www.ebi.uniprot.org/entry/G3P1_SHIFL
    Identity: 82.282 %
    Similar: 82.282 %
    E: 2.2e-40 
    Provides sequence similarity searching against nucleotide and protein databases using the Fasta programs. Fasta can be very specific when identifying long regions of low similarity especially for highly diverged sequences. You can also conduct sequence similarity searching against complete proteome or genome databases using the Fasta programs.
    MPsrch: http://www.ebi.uniprot.org/entry/G3P1_ECOL6
    Match: 82.3 %
    Query Match: 58.9 %
    Score: 1476
    MPsrch is a biological sequence sequence comparison tool that implements the true Smith and Waterman algorithm. It runs a search on a HP/ COMPAQ cluster, using single and parallelised versions of the software. It allows an rigorous search in a reasonable computational time. MPsrch utilises an exhaustive algorithm, which is recognised as the most sensitive sequence comparison method available, whereas Blast and Fasta utilise a heuristic one. As a consequence, MPsrch is capable of identifying hits in cases where Blast and Fasta fail and also reports fewer false-positive hits.
    ScanPS: http://www.ebi.uniprot.org/entry/G3P1_SHIFL
    Score: 1418
    SCANPS (Scan Protein Sequence) is a program for comparing a protein sequence to a database of protein sequences. It implements the full Smith-Waterman style searching and is capable of identifying multiple domain matches by using iterative profile searching.
    Kõige paremini sobib MPsrch
  • Vasakule Paremale
    Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #1 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #2 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #3 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #4 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #5 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #6 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #7 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #8 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #9 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #10 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #11 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #12 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #13 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #14 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #15 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #16 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #17 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #18 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #19 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #20 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #21 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #22 Järjestuste võrdlemine-otsingud andmebaasidest-BLAST-FASTA-SW- #23
    Punktid 100 punkti Autor soovib selle materjali allalaadimise eest saada 100 punkti.
    Leheküljed ~ 23 lehte Lehekülgede arv dokumendis
    Aeg2012-11-01 Kuupäev, millal dokument üles laeti
    Allalaadimisi 41 laadimist Kokku alla laetud
    Kommentaarid 0 arvamust Teiste kasutajate poolt lisatud kommentaarid
    Autor Mumm Õppematerjali autor
    Bioinformaatika ülesanded

    Kasutatud allikad

    Sarnased õppematerjalid

    Lühendite seletus
    120
    doc

    Lühendite seletus

    A... AA Auto Answer AAA Authentication, Authorization and Accounting AAB All-to-All Broadcast AAC Advanced Audio Coding AACS Advanced Access Control System AAL Asynchronous Transfer Mode Adaption Layer AAM Automatic Acoustic Management AAP Applications Access Point [DEC] AARP AppleTalk Address Resolution Protocol AAS All-to-All Scatter AASP ASCII Asynchronous Support Package AAT Average Access Time AATP Authorized Academic Training Program [Microsoft] .ABA Address Book Archive (file name extension) [Palm] ABAP Advanced Business Application Programming [SAP] ABC * Atanasoff-Berry Computer (First digital calculating machine that used vacuum tubes) ABEND Abnormal End ABI Application Binary Interface ABIOS Advanced BIOS ABIST Automatic Built-In Self-Test [IBM] ABLE Adaptive Battery Life Extender + Agent Building and Learning Environment [IBM] ABM Asynchronous Balanced Mode ABR Available Bit Rate ABRD

    Informaatika
    Inglise keel unit 5 answers
    276
    docx

    Inglise keel unit 5 answers

    1. (a) (i) gene length of DNA; codes for a (specific), polypeptide / protein / RNA; max 1 allele alternative form of a gene; found at a, locus / particular position on, a chromosome; max 1 (ii) assume allele refers to coat colour allele (coat colour) gene / alleles, only on X chromosome; A no (coat colour), gene / allele, on Y chromosome male cats, XY / only have one X chromosome; males have only one (coat colour) allele / cannot have two (coat colour) alleles; need black and orange alleles for tortoiseshell colour; 2 r r w w (b) parental genotypes C C × C C ; r w gametes C , C ; F1 genotypes and pheno

    Inglise keel
    Liha töötlemine
    1168
    pdf

    Liha töötlemine

    Handbook of Meat Processing Handbook of Meat Processing Fidel Toldrá EDITOR A John Wiley & Sons, Inc., Publication Edition first published 2010 © 2010 Blackwell Publishing Blackwell Publishing was acquired by John Wiley & Sons in February 2007. Blackwell’s publishing program has been merged with Wiley’s global Scientific, Technical, and Medical business to form Wiley-Blackwell. Editorial Office 2121 State Avenue, Ames, Iowa 50014-8300, USA For details of our global editorial offices, for customer services, and for information about how to apply for permission to reuse the copyright material in this book, please see our website at www.wiley.com/ wiley-blackwell. Authorization to photocopy items for internal or personal use, or the internal or personal use of specific clients, is granted by Blackwell Publishing, provided that the base fee is paid directly to the Copyright Clearance Center, 222 Rosewood Drive, Danvers, MA 01923. F

    Inglise keel
    Book Analog Interfacing to Embedded Microprocessors
    568
    pdf

    Book Analog Interfacing to Embedded Microprocessors

    Analog Interfacing to Embedded Microprocessors Real World Design Analog Interfacing to Embedded Microprocessors Real World Design Stuart Ball Boston Oxford Auckland Johannesburg Melbourne New Delhi Newnes is an imprint of Butterworth–Heinemann. Copyright © 2001 by Butterworth–Heinemann A member of the Reed Elsevier group All rights reserved. No part of this publication may be reproduced, stored in a retrieval system, or transmitted in any form or by any means, electronic, mechanical, photocopying, recording, or otherwise, without the prior written permission of the publisher. Recognizing the importance of preserving what has been written, Butterworth–Heinemann prints its books on acid-free paper whenever possible. Library of Congress Cataloging-in-Publication Data Ball, Stuart R., 1956– Analog interfacing to embedded microprocessors : real world design / Stuart Ball. p. cm. ISBN 0-7506-7339-7 (pbk. : alk. paper) 1. Embedded computer

    Mehhatroonika
    Programmeerimiskeel
    555
    doc

    Programmeerimiskeel

    tutvu lausearvutuse keskkonnaga: http://logik.phl.univie.ac.at/~chris/gateway/formular-uk-zentral.html Millistel muutuja väärtustel on lause (Av(B&A))v(-A&(Cv(B&-C))) väär? Panna tuleb results only, 0 on väär 1 on õige Tutvu ajalooga saidis kuni II maailmasõda: http://www.maxmon.com/history.htm Loe läbi jutt ja proovi andmetega mängida: http://math.hws.edu/TMCM/java/DataReps/index.html Kahend süsteemi arvu(101101001) ->kümnend süsteemiks. Nr sisse ja bianarile punkt, ja vaatan base ten integeri kümnendarvudest annab Ecki appletis juuresoleva graafilise kujutise, teen kujundi ja vaatan base integeri mis vastab kahendsüsteemi arvule 1110001 ASCII tabelis? Nr sisse ja punkt bianari, vaatan ...teksti Kümnendsüsteemi arv 33 on kahendsüsteemis? 33 kirjutan ja Base-ten integer, vaatan bianary Loe läbi jutud Atbashi ja Caesari šifri (Caesar cipher) kohta: http://www.wikipedia.org 2 Tutvu ajalooga kuni 1970ndad: http://www.islandnet.com/~kpolsson/comphist/ 47-68 ingli

    Infotehnoloogia
    Fitness In Soccer
    409
    pdf

    Fitness In Soccer

    [email protected] 06 Aug 2018 FITNESS IN SOCCER THE SCIENCE AND PRACTICAL APPLICATION Jan Van Winckel, Werner Helsen, Kenny McMillan, David Tenney, Jean-Pierre Meert, Paul Bradley [email protected] 06 Aug 2018 Isbn-number : 9789082132304 Publisher: Moveo Ergo Sum / Klein-Gelmen Proofreading: Jim Newall Quill Content |Writing, Editing and Web site services http://www.quillsites.co.uk Photos: Jean Leemans and Etienne Claessens Cover and lay-out: Dots & Bits © 2014 Jan Van Winckel Printed and bound at Manipal Technologies Ltd., India All rights reserved. No pa

    Kategoriseerimata
    Ford escorti käsiraamat
    256
    pdf

    Ford escorti käsiraamat

    1·1 Chapter 1 Routine maintenance and servicing 1 Contents Air cleaner element renewal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .34 Fuel filter renewal - fuel injection engines . . . . . . . . . . . . . . . . . . . .36 Alternator drivebelt check . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .20 Hinge and lock check and lubrication . . . . . . . . . . . . . . . . . . . . . . .31 Automatic transmission fluid level check . . . . . . . . . . . . . . . . . . . . .27 Idle speed and mixture adjustment . . . . .

    Auto õpetus
    The 4-Hour Body - An Uncommon Guide to Rapid Fat-Loss-Incredible Sex-and Becoming Superhuman - Timothy Ferriss
    574
    pdf

    The 4-Hour Body - An Uncommon Guide to Rapid Fat-Loss, Incredible Sex, and Becoming Superhuman - Timothy Ferriss

    PRAISE FOR The 4-Hour Workweek "This is a whole new ball game. Highly recommended." --Dr. Stewart D. Friedman, adviser to Jack Welch and former director of the Work/Life Integration Program at the Wharton School, University of Pennsylvania "It's about time this book was written. It is a long-overdue manifesto for the mobile lifestyle, and Tim Ferriss is the ideal ambassador. This will be huge." --Jack Can eld, cocreator of Chicken Soup for the Soul®, 100+ million copies sold "Stunning and amazing. From mini-retirements to outsourcing your life, it's all here. Whether you're a wage slave or a Fortune 500 CEO, this book will change your life!" --Phil Town, New York Times bestselling author of Rule #1 "The 4-Hour Workweek is a new way of solving a very old problem: just how can we work to live and prevent our lives from being all about work? A world of in nite options awaits those who would read this book an

    Inglise keel




    Meedia

    Kommentaarid (0)

    Kommentaarid sellele materjalile puuduvad. Ole esimene ja kommenteeri



    Sellel veebilehel kasutatakse küpsiseid. Kasutamist jätkates nõustute küpsiste ja veebilehe üldtingimustega Nõustun