Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
4 changes: 4 additions & 0 deletions test/fixtures/reference/README.md
Original file line number Diff line number Diff line change
Expand Up @@ -20,6 +20,10 @@ Unheadered 2 column TSV file containing genelengths with `gene_name` labels from

Gencode v31 release GTF (or GFFv2) file, subsetted to only contain annotations for `chrY` and `chrM`. Gzipped.

## gencode.v50.BCR_ABL1.transcripts.fa.gz

Gencode v50 release protein-coding transcript sequences FASTA, subsetted to only contain sequences from the genes BCR and ABL1. Gzipped.

Copy link
Copy Markdown
Member

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

I'm not fully familiar with the gencode transcript reference, but does it actually contain the gene labels (e.g. BCR, ABL1). If so did you just grep for those plus protein_coding or something?

Short version, is this enough information to recreate the file easily?

Copy link
Copy Markdown
Member Author

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

I created them "by hand": opened the whole file in my editor, searched for the gene labels, copy and pasted into a new file. It could be done with some Bash-Fu, but that is complicated by the released FASTA formatting being linebroken on nucleotide 80 (or something around that) of each line.

$  gunzip -c test/fixtures/reference/gencode.v50.BCR_ABL1.transcripts.fa.gz | head -n 50
>ENST00000928586.2|ENSG00000186716.23|OTTHUMG00000150655.5|-|BCR-216|BCR|6876|UTR5:1-596|CDS:597-4361|UTR3:4362-6876|
GGGGGGAGGGTGGCGGCTCGATGGGGGAGCCGCCTCCAGGGGGCCCCCCCGCCCTGTGCC
CACGGCGCGGCCCCTTTAAGAGGCCCGCCTGGCTCCGTCATCCGCGCCGCGGCCACCTCC
CCCCGGCCCTCCCCTTCCTGCGGCGCAGAGTGCGGGCCGGGCGGGAGTGCGGCGAGAGCC
GGCTGGCTGAGCTTAGCGTCCGAGGAGGCGGCGGCGGCGGCGGCGGCACGGCGGCGGCGG
GGCTGTGGGGCGGTGCGGAAGCGAGAGGCGAGGAGCGCGCGGGCCGTGGCCAGAGTCTGG
CGGCGGCCTGGCGGAGCGGAGAGCAGCGCCCGCGCCTCGCCGTGCGGAGGAGCCCCGCAC
ACAATAGCGGCGCGCGCAGCCCGCGCCCTTCCCCCCGGCGCGCCCCGCCCCGCGCGCCGA
GCGCCCCGCTCCGCCTCACCTGCCACCAGGGAGTGGGCGGGCATTGTTCGCCGCCGCCGC
CGCCGCGCGGGCCATGGGGGCCGCCCGGCGCCCGGGGCCGGGCTGGCGAGGCGCCGCGCC
GCCGCTGAGACGGGCCCCGCGCGCAGCCCGGCGGCGCAGGTAAGGCCGGCCGCGCCATGG
TGGACCCGGTGGGCTTCGCGGAGGCGTGGAAGGCGCAGTTCCCGGACTCAGAGCCCCCGC
GCATGGAGCTGCGCTCAGTGGGCGACATCGAGCAGGAGCTGGAGCGCTGCAAGGCCTCCA
TTCGGCGCCTGGAGCAGGAGGTGAACCAGGAGCGCTTCCGCATGATCTACCTGCAGACGT
TGCTGGCCAAGGAAAAGAAGAGCTATGACCGGCAGCGATGGGGCTTCCGGCGCGCGGCGC
AGGCCCCCGACGGCGCCTCCGAGCCCCGAGCGTCCGCGTCGCGCCCGCAGCCAGCGCCCG
CCGACGGAGCCGACCCGCCGCCCGCCGAGGAGCCCGAGGCCCGGCCCGACGGCGAGGGTT
CTCCGGGTAAGGCCAGGCCCGGGACCGCCCGCAGGCCCGGGGCAGCCGCGTCGGGGGAAC
GGGACGACCGGGGACCCCCCGCCAGCGTGGCGGCGCTCAGGTCCAACTTCGAGCGGATCC
GCAAGGGCCATGGCCAGCCCGGGGCGGACGCCGAGAAGCCCTTCTACGTGAACGTCGAGT
TTCACCACGAGCGCGGCCTGGTGAAGGTCAACGACAAAGAGGTGTCGGACCGCATCAGCT
CCCTGGGCAGCCAGGCCATGCAGATGGAGCGCAAAAAGTCCCAGCACGGCGCGGGCTCGA
GCGTGGGGGATGCATCCAGGCCCCCTTACCGGGGACGCTCCTCGGAGAGCAGCTGCGGCG
TCGACGGCGACTACGAGGACGCCGAGTTGAACCCCCGCTTCCTGAAGGACAACCTGATCG
ACGCCAATGGCGGTAGCAGGCCCCCTTGGCCGCCCCTGGAGTACCAGCCCTACCAGAGCA
TCTACGTCGGGGGCATGATGGAAGGGGAGGGCAAGGGCCCGCTCCTGCGCAGCCAGAGCA
CCTCTGAGCAGGAGAAGCGCCTTACCTGGCCCCGCAGGTCCTACTCCCCCCGGAGTTTTG
AGGATTGCGGAGGCGGCTATACCCCGGACTGCAGCTCCAATGAGAACCTCACCTCCAGCG
AGGAGGACTTCTCCTCTGGCCAGTCCAGCCGCGTGTCCCCAAGCCCCACCACCTACCGCA
TGTTCCGGGACAAAAGCCGCTCTCCCTCGCAGAACTCGCAACAGTCCTTCGACAGCAGCA
GTCCCCCCACGCCGCAGTGCCATAAGCGGCACCGGCACTGCCCGGTTGTCGTGTCCGAGG
CCACCATCGTGGGCGTCCGCAAGACCGGGCAGATCTGGCCCAACGATGGCGAGGGCGCCT
TCCATGGAGACGCAGATGGCTCGTTCGGAACACCACCTGGATACGGCTGCGCTGCAGACC
GGGCAGAGGAGCAGCGCCGGCACCAAGATGGGCTGCCCTACATTGATGACTCGCCCTCCT
CATCGCCCCACCTCAGCAGCAAGGGCAGGGGCAGCCGGGATGCGCTGGTCTCGGGAGCCC
TGGAGTCCACTAAAGCGAGTGAGCTGGACTTGGAAAAGGGCTTGGAGATGAGAAAATGGG
TCCTGTCGGGAATCCTGGCTAGCGAGGAGACTTACCTGAGCCACCTGGAGGCACTGCTGC
TGCCCATGAAGCCTTTGAAAGCCGCTGCCACCACCTCTCAGCCGGTGCTGACGAGTCAGC
AGATCGAGACCATCTTCTTCAAAGTGCCTGAGCTCTACGAGATCCACAAGGAGTTCTATG
ATGGGCTCTTCCCCCGCGTGCAGCAGTGGAGCCACCAGCAGCGGGTGGGCGACCTCTTCC
AGAAGCTGGCCAGCCAGCTGGGTGTGTACCGGGCCTTCGTGGACAACTACGGAGTTGCCA
TGGAAATGGCTGAGAAGTGCTGTCAGGCCAATGCTCAGTTTGCAGAAATCTCCGAGAACC
TGAGAGCCAGAAGCAACAAAGATGCCAAGGATCCAACGACCAAGAACTCTCTGGAAACTC
TGCTCTACAAGCCTGTGGACCGTGTGACGAGGAGCACGCTGGTCCTCCATGACTTGCTGA
AGCACACTCCTGCCAGCCACCCTGACCACCCCTTGCTGCAGGACGCCCTCCGCATCTCAC
AGAACTTCCTGTCCAGCATCAATGAGGAGATCACACCCCGACGGCAGTCCATGACGGTGA
AGAAGGGAGAGCACCGGCAGCTGCTGAAGGACAGCTTCATGGTGGAGCTGGTGGAGGGGG
CCCGCAAGCTGCGCCACGTCTTCCTGTTCACCGACCTGCTTCTCTGCACCAAGCTCAAGA
AGCAGAGCGGAGGCTTCCAGATGGTGGATGAACTGGAGGCAGTGCCCAACATCCCCCTGG
TGCCCGATGAGGAGCTGGACGCTTTGAAGATCAAGATCTCCCAGATCAAGAATGACATCC

Copy link
Copy Markdown
Member Author

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

as for the protein coding part, the gencode site hosts a subsetted transcriptome of just protein-coding transcripts, which was the file I started with


## GRCh38.chr1_chr19.dict

Sequence dictionary for GRCh38 reference containing `chr1` and `chr19` only
Expand Down
Git LFS file not shown
Loading