Posts tonen met het label business intelligence. Alle posts tonen
Posts tonen met het label business intelligence. Alle posts tonen

dinsdag, februari 17, 2009

Dataintegratie op AWS



Mijn vorige post ging over dbms-en voor datawarehouses op EC2. Ik was blijven steken bij de vraag, hoe je de gegevens naar EC2 kunt transporteren en daar kunt integreren. Ik heb een lijstje gemaakt van dataintegratietools die iets met AWS doen.

Wat opvalt is dat het bijna allemaal open source dataintegratietools zijn. Niet heel verwonderlijk want het huidige businessmodel voor commerciële software past 'niet helemaal' bij het cloudconcept i.e. alleen betalen voor het gebruik.

Open source is in principe gratis en daardoor lijken cloudcomputing en open source een symbiotisch droomkoppel. De huidige crisis kan zelfs als katalysator werken voor een snelle acceptatie van deze combi. Al zijn er volgens UC berkeley nog een aantal belangrijke obstakels voor cloudcomputing en zijn er volgens Informationweek nog 6 dingen die SAAS moet doen om in 2009 als volwaardige technologie geaccepteerd te worden.

De dataintegratietools voor AWS.

Logixml
logixml is een BI platform met een etl-component dat connecteert naar Simpledb, Salesforce en willekeurig andere webservices. Het is de enige niet opensource tool.

Apatar
Apatar is opensource dataintegratie software met connectoren voor SAP, siebel, Sugarcm en AWS.

Snaplogic

Open source dataintegratietool voor SAAS applicaties, Snaplogic, is geoptimaliseerd voor AWS.

Pentaho
Maar Pentaho is volgens mij het meest ver met AWS. Het blog VM Datamining heeft een serie posts over de installatie van Pentaho Data Integration oftewel kettle op EC2. Matt Casters, de architect van Kettle beschrijft op zijn blog dat Kettle zeer overtuigend schaalt op EC2 en stelt dat AWS ongekende mogelijkheden biedt tegen zeer lage kosten.

Bovendien komt er blijkbaar binnenkort een AMI (Amazon Machine Image) voor Pentaho Data Integration. Er is is zelfs al op AWS een datawarehouse gebouwd met Mysql en Pentaho. Zo onrijp, zoals ik in mijn vorige post stelde, is AWS als dwhplatform dus ook weer niet.

woensdag, december 10, 2008

rss als annotatie-hulpmiddel in rapportages



Ik ben een groot fan van de grafieken van Google insights for search en finance. Zie bv hoe Google de beurskoers van mijn favoriete aandeel Netezza integreert met belangrijke gebeurtenissen. Dat is toch weer fraai gedaan door de interface ontwerpers van Google.

Ik vroeg me af of het ook mogelijk is zelf dergelijke rapportages te bouwen.
Zo zou je je kunnen voorstellen dat de marketeers van een krant willen weten welke nieuwsfeiten van invloed zijn op de losse verkoop.

Die nieuwsfeiten zijn als rss-feed opvraagbaar en die moet je op een of andere manier verwerken als annotaties bij de verkoopcijfers. Nog beter zou het zijn als je uit Google Analytics als rss-feed de best bekeken artikelen zou kunnen opvragen, om te zien welk nieuwsfeit die dag belangrijk was. Helaas is dat laatste nog niet mogelijk.

Overigens kun je ook heel gemakkelijk bedrijfsinterne nieuwsfeiten vastleggen in de vorm van een weblog, waarin je vastlegt wanneer bv het bronsysteem is gemigreerd. De rss-feed van dat weblog verklaart dan weer de trendbreuk in die ene grafiek.

Google spreadsheets heeft de mogelijkheid om annotaties te maken in de vorm van interactieve time series gadget van Google. Het is ook vrij gemakkelijk een rss-feed met relevant nieuws in google spreadsheets te importeren. Maar voor de koppeling van rapportdata met rss-feeds op basis van datum of onderwerp heeft Google geen kant en klare oplossing.

Ook bij Business Intelligence leveranciers kon ik nog geen commercieel rijpe oplossingen vinden. In het lab van Business Objects staan wel 2 proefopstellingen:

Rss-feed as a universe ontsluit een rss-feed via een Universe waardoor deze gegevens schijnbaar te combineren zijn met andere gegevens.
BI Annotator is een tool voor BOXI en combineert de ongestructureerde text uit een rss-feed met bv de dimensionele data uit een sterschema. Het wordt niet helemaal duidelijk of de tijdsdimensie hierbij een rol speelt.

Eigenlijk moet je de rss-feeds met de andere data integreren in het datawarehouse en moet je dit niet willen oplossen met een BI-tool. Hoe je dit in het dwh moet modelleren is een vraagstuk op zich bv als aparte rss-dimensies of als onderdeel van een andere dimensie of als aparte ster met nieuwsfeiten. Misschien dat ik daar nog wat blogjes aan ga wijden.

Integratie van rss-feeds in rapportages is dus volgens mij met de huidige BI-tools nog niet mogelijk. Misschien dat iemand anders nog wel een oplossing heeft gevonden?

maandag, september 08, 2008

Google Charts (api)

Dit is een blog in een serie waarin ik probeer te ontdekken of Google geschikt is als BI-platform. Ik heb ze gelabeld als Gbi (Google bi).

Een van de minder bekende api's van Google is de Google Chart api. Door simpelweg een url te maken met een aantal parameters, zoals type, kleur en labels en daarbij de waarden op te geven, tover je een statische grafiek in .png formaat in de browser. Hiermee kun je verrassend mooie en veelzijdige grafieken maken die zeker niet onderdoen voor de grafiekmogelijkheden van dure rapportagetools.

De vraag is nu of je met Google Charts een Google business intelligence oplossing zou kunnen bouwen. Ik stel me daarbij voor dat je Igoogle wilt gebruiken als platform om rapporten te tonen.

Met Google Graphs blijkt dat ronduit lastig te zijn. De resultaten van een query moet je via handgecodeerde scripts omzetten in de gewenste attributen met de bijbehorende resultaatsets. Voor de gemiddelde BI-er een stap te ver. Daarnaast zijn de grafieken statisch: tooltips en een drillthrough zijn niet mogelijk. Wat in dit geval ontbreekt is een laag die de resultaten van een query eenvoudig omzet naar een grafiek (met een tabel). En dan laat ik het afschermen van de sql in een semantische laag even buiten beschouwing. Via een lelijke hack met de google gadgets api kun je de plaatjes alsnog in iGoogle tonen.

Maar als je je niet laat intimideren door code zijn er met deze api hele mooie grafieken te maken die het best tot hun recht komen in een mashup. Zie bv de combinatie van twitterstatistieken met yahoo pipes en google charts en de andere voorbeelden op programmableweb.

Kortom een normale bi-er zal van Google Graphs niet blij worden. Gelukkig zijn er alternatieven zoals de visualization api, maar daarover in een volgende post meer.

Mocht je toch nieuwsgierig zijn geworden: Er zijn verschillende graph generatoren, waaronder het fraaie hohli, om te spelen met de verschillende grafieken.

dinsdag, maart 20, 2007

Datavisualisatie: Second Life versus Croquet

3D-werelden als Second Life hebben een enorme potentie om informatie op een geheel nieuwe wijze te presenteren. De persconferentie van een jaarverslag in een 3D-wereld zou bijvoorbeeld gedaan kunnen worden als een virtuele rondleiding langs een aantal tentoongestelde grafieken.

Voor business intelligence biedt zo'n wereld ongekende mogelijkheden om data te visualiseren. Bijvoorbeeld door met data een landschap te ontwerpen waarin data-analisten vrij rond kunnen zwerven om allerlei verbanden te zoeken.

Maar het is momenteel al een hele kunst om een presentatie in second life te geven met powerpoint. En de scripttaal van second life lijkt niet heel geschikt om echt spectaculaire data visualisaties te bouwen. Second life is gewoon niet gebouwd met dat doel voor ogen. Hoewel er hier en daar toch mooie data visualisaties zijn te vinden, zoals realtime visualisatie van het weer en dit model om complexe informatie weer te geven.

Croquet is een 3d-wereld die wel specifiek ontworpen is voor data visualisatie, virtueel leren en voor probleem oplossende omgevingen. Daarnaast is het niet opgezet als een groot monolithisch systeem als second life, maar als een verzameling losse werelden die eventueel aan elkaar te knopen zijn, waardoor die gegevens goed af te schermen zijn voor niet-bevoegden.

Bovendien is Croquet open source en gebouwd met squeak, een smalltalk implementatie. En die omgeving lijkt wel krachtig genoeg om - over niet al te lange tijd - prachtige datalandschappen te ontwerpen als virtueel bi-landschap-architect.

maandag, maart 19, 2007

Google koopt Trendanalyzer

Google's doel om 's werelds informatie te ontsluiten en universeel beschikbaar en bruikbaar te maken, is weer een stapje dichterbij door de aanschaf van Trendanalyzer, het datavisualisatie tool van de Gapminder foundation.

In het officepakket van google ontbreekt nog een presentatietool en een aangepaste versie van trendanalyzer zou daar uitstekend geschikt voor zijn. Of zijn het Google's eerste voorzichtige schreden in BI-land?

vrijdag, februari 23, 2007

Data mashups platformen voor bi

Getriggerd door mijn eigen post over mashups, heb ik nog verder gesnuffeld naar enterprise web 2.0 voorbeelden van mashups. Ik heb 2 voorbeelden gevonden: Oracle en Denodo.

Nu blijkt Oracle pas Webcenter suite geïntroduceerd te hebben. Dat is een toolset is om data uit applicaties met web 2.0 technieken - inclusief mashups- te integreren en om users te laten collaboreren via wiki's en weblogs. De user interface die met webcenter is te bouwen wordt hier gedemo-ed. Het enterprise web 2.0 blog is er overigens niet zo over te spreken.

Denodo is een Spaans bedrijf dat zich geheel richt op 'data mashups voor the enterprise'. De denodo data mashup architectuur integreert gestructureerde data uit bedrijfsapplicaties met ongestuctureerde data van het web of uit interne bronnen. De mashup is de plek waar die data samenkomt. De kracht van Denodo zit ook gedeeltelijk in een techniek om die ongestructureerde data te clusteren en/of samen te vatten. Denodo heeft 2 webinars en interview over het platform online staan.

woensdag, februari 21, 2007

BI 2.0: mashups

BI 2.0, niemand weet nog precies waarvoor het staat maar het kan te maken te hebben met ajax, realtime bi, operational bi, web 2.0, enterprise search, soa's of on demand of al deze begrippen. Erik Fransen verzamelt voor dbm ideeën voor een artikel over BI 2.0.

Hier wil ik ingaan op de web 2.0 component van BI 2.0 en dan speciaal mashups. Want een mashup wordt in de wikipedia gedefinieerd als een website of applicatie die data uit verschillende bronnen combineert tot 'een nieuwe ervaring'. En dat riekt verdacht veel naar BI.

Pentaho is een voorbeeld van een BI tool waarmee een mashup is te maken met Googlemaps. Ook Business Objects heeft een mashuptool in de vorm van graphicsmasher maar die is alleen nog maar te bewonderen in het lab.

Het maken van mashups is redelijk ingewikkeld, maar er komt een nieuwe klasse van tools aan waarmee dit een eitje wordt. In SOA for the masses geven Dan Farber en Larry Digna een uitstekend overzicht van deze tools. De meest revolutionaire zijn Teqlo en het net geïntroduceerde Yahoo Pipes.

De uitdaging voor BI-consultants en leveranciers is om die tools voor het maken van mashups ter beschikking te stellen aan de bi-eindgebruikers en wel op zo'n manier dat die mashups beheerbaar blijven. Want dat is met Excel, het mix, mash en mutate tool van het client/server tijdperk niet echt gelukt.

maandag, februari 12, 2007

Enron explorer


Trampoline Systems heeft een 'interessant' product, waarmee je sociale netwerken, expertise en informatiestromen in kaart brengt binnen een bedrijf. De gemiddelde werknemer zit er ongetwijfeld niet op te wachten dat zijn mail wordt afgetapt.

Maar die enorme berg ongestructureerde data uit email, levert - eenmaal gestructureerd - zeer waardevolle informatie op over een bedrijf. Dat wordt geweldig gedemonstreerd aan de hand van de nu openbare mailwisseling binnen de Enron top. Deze is te rangschkken naar onderwerp en persoon. Bovendien is te zien wie met wie communiceerde.

maandag, februari 05, 2007

Een puzzel of een mysterie aanpak

Malcom Gladwell (van Blink en de Tipping Point) schrijft in de New Yorker over een leuk nieuw inzicht, afkomstig van intelligence expert Gregory Treverton: Het verschil tussen puzzels en mysteries.

"Osama bin Laden’s whereabouts are a puzzle. We can’t find him because we don’t have enough information. The key to the puzzle will probably come from someone close to bin Laden, and until we can find that source bin Laden will remain at large."

"The problem of what would happen in Iraq after the toppling of Saddam Hussein was, by contrast, a mystery. It wasn’t a question that had a simple, factual answer. Mysteries require judgments and the assessment of uncertainty, and the hard part is not that we have too little information but that we have too much."

Gladwell beschrijft aan de hand van de van het Enron-schandaal en een verhaal over het geheime superwapen van de nazi's dat een intelligence probleem niet perse opgelost moet worden als een puzzel dwz door meer informatie te verzamelen. Een mysterie-insteek bleek in bovenstaande gevallen succesvoller.

Avinash en de jongens van Juice Analytics hebben de knuppel in het hoenderhok gegooid. Ze vragen zich of we Business Intelligence of web analytics vraagstukken wel als een puzzle moeten oplossen door bv zo veel mogelijk data te verzamelen over klanten. Zou een mysterie-achtige aanpak niet beter werken?

Search in BI

Zijn de BI-spelers voorzichtig wat zoekmogelijkheden in hun oplossingen aan het verwerken. De search spelers pakken het drastische aan en bieden search als BI oplossing aan. Zo introduceren 2 leiders van Gartners 'Information Access Magic Quadrant', een naar eigen zeggen, fundamenteel andere manier om BI te bedrijven.

Fast introduceert het Adaptive Information Warehouse (AIW) dat bestaat uit een data cleansing tool en een data analyse tool, radar, genaamd. Computerworld laat een aantal analisten aan het woord over AIW.

De onderliggende techniek noemen ze bij Fast de Pyramid server, dat wordt gepresenteerd als een alternatief voor kubussen. Zo op het eerste gezicht komt het op mij over, alsof ze BI-software hebben ontwikkeld ipv dat ze hun zoekmachine hebben ingezet voor een BI-oplossing.
Het meaning analytics warehouse van Autonomy lijkt spectaculairder. Dat is een module die informatie uit video, email, database etc indexeert, transformeert en analyseert obv betekenis en relaties. Meer informatie is er nog niet over te vinden.

woensdag, januari 03, 2007

Data warehousing on ruby rails

rails.pngRuby on Rails is een webontwikkelingsraamwerk waarmee je relatief eenvoudig, prachtige webapplicaties kunt bouwen, zoals shopify, odeo en 43things laten zien.

Althans, dat nam ik maar aan, maar je kunt er natuurlijk veel meer mee. Zo is Anthony Eden begonnen met het ontwikkelen van een data warehouse extensie op Ruby.

Active Warehouse is de naam van zijn Rubyforge Project. Het is in december 2006 gestart en het project is nog in de 0.1 fase. Liefhebbers kunnen aanhaken want het project zoekt nog 3 ontwikkelaars. Een eerste versie van een ETL-tool is al gebouwd.

woensdag, december 20, 2006

De meest innovatieve pure BI-players volgens Google Patents


metadata.jpg

Hoe innovatief zijn de pure BI players? Dat kun je nu aardig meten met google patentsearch. Ik heb de grootste spelers van het BI veld gegoogeld:

  1. Microstrategy: 44 patenten

  2. Cognos: 16 patenten

  3. Hyperion: 12 patenten

  4. Business Objects: 7 patenten (inclusief 1 van acta)


Zegt dit nu iets? Dat weet ik eigenlijk niet. Bedrijven zullen innovatieve patenten gebruiken die niet op hun naam staan. Sommige patenten lijken onnozel: bv 'een userinterface for a computerscreen'. En waarschijnljk staan er patenten op naam van bedrijven die zijn overgenomen. Andere patenten zijn misschien al weer achterhaald. Kortom, beetje nutteloze excercitie. Het is wel aardig om door de tekeningen van de patenten te browsen, als je echt niets te doen hebt.

maandag, december 11, 2006

Voor datafreaks: Swivel

1020867

Dé oplossing voor data-analisten die nu eindelijk wel eens verrassende verbanden in hun data willen vinden: Swivel. Swivel is een web 2.0 site waar je gegevenssets met elkaar deelt, vergelijkt, becommentarieert en tagt. Wat swivel bijzonder/bizar maakt is dat je alle beschikbare gegevens tegen elkaar kunt afzetten.
Laad een gegevensset op en Swivel komt automatisch terug met verbanden die je in je wildste fantasieen niet had kunnen verzinnen. En misschien dat deze site wel gaat bewijzen dat alles met alles samenhangt, als er tenminste niet al te veel valse gegevens worden geupload.

donderdag, december 07, 2006

Mooie dashboards ontwerpen


poster_OrigMinard.gif

Juice analytics heeft 1, 2 posts over een videopresentatie van Seth Godin waarin hij de beroemde Napoleon-grafiek, volgens Tufte de beste ooit gemaakt, afkraakt.

De essentie van zijn kritiek is dat je de grafiek 15 minuten moet bestuderen voordat je door hebt wat er staat. 'Goed' is volgens Godin afhankelijk van de context. In de context van het bedrijfsleven is het één van de slechtse grafieken ooit gemaakt, want daar moet een grafiek in een paar seconden duidelijk maken wat ermee bedoeld wordt.

Wat een goede grafiek in het bedrijfsleven is, is door de dashboard-hype een hot item. Hieronder een aantal sites waar hierover info te vinden is.

maandag, november 27, 2006

Veel BI in Top 30 IT trends 2007

CIO Insight heeft, obv enquetes onder cio's en cto's, een top 30 samengesteld met de belangrijkste IT-trends voor 2007. En niet geheel verwonderlijk, speelt BI daar een belangrijke rol in.

In de categorie strategie staat op de 5e plaats: "Companies put their mounds of data to work". Het blijkt dat bedrijven zo'n 43% van de gegenereerde klantdata verzamelen en analyseren. 52% van de business users klaagt erover dat ze niet de informatie krijgen die ze nodig hebben.

In de categorie technologie staat "dataquality demands attention" op de 3e plaats. Maar 4% van de ondervraagden beschouwt de interne, externe en gestructureerde en ongestructureerde data als 'uitstekend'.

Op de 7e plaats in de categorie technologie staat: "for business Intelligence, the best has yet to come". BI blijkt in meer IT budgetten voor te komen dan elk ander it-initiatief.

dinsdag, november 21, 2006

Open source business intelligence overzicht

pentaho.jpg Pentaho is de eerste open source Business Intelligence suite (1,5 miljoen downloads) dat serieus zou kunnen concurreren met commerciele BI-leveranciers. Pentaho is een bi-platform met rapportage, analyse, dashboarding,workflow en datamining mogelijkheden.

En bij pentaho alleen zal het niet blijven. Er zijn nu al zo'n 25 open source projecten voor Business Intelligence tools. De open source bi pagina van squidoo biedt een uitstekend overzicht. Een paar kansrijke suites en olap tools pik ik er hier uit:

  • Het BEE-project is een tjechisch project met etl, rolap en rapportagemogelijkheden, met mysql als onderliggende database.

  • Open-i is een olap rapportage omgeving dat draait op Mondrian of Microsoft Analysis services. Het project was finalist voor de sourceforge community choice awards.

  • SpagoBi is een italiaans project en een compleet platform met datamining, rapportage, olap, dashboards en datamanagement oplossingen.

  • Palo, is een addin voor Excel. Aan Excel wordt een MOLAP-database toegevoegd waardoor je een hoeveelheid data gelijk aan 1000-en excelsheets in één excelsheet kunt bewerken die ook nog eens meer mogelijheden biedt.

maandag, november 20, 2006

Oracle Open World BI presentaties


oraclebi.jpg



De presentaties van het Oracle open world forum 2006 staan online. Oracle heeft daar nogal belangrijke aankondigen gedaan over haar BI-strategie. Hieronder staan een aantal presentaties over Business Intelligence die ook zonder bijbehorende commentaar interessant zijn (username=cboracle password=oraclec6):

Er staan nog veel meer presentaties en cases van het oracle open world forum. En 28 november is Bi City, een eendaags seminar van Oracle, waar je ongetwijfeld bijgepraat gaat worden over deze onderwerpen.

Eén versie van de waarheid

Eén van de argumenten voor een data warehouse is, dat het voor een organisatie één versie van de waarheid oplevert . Als data manager met een postmodernistische inslag moet ik daar altijd een beetje om gniffelen.

Op een basaal niveau klopt dat argument ook wel. Er gaat altijd veel tijd zitten in het verklaren van verschillen in rapporten over hetzelfde onderwerp die afkomstig zijn uit verschillende bronnen en/of van verschillende afdelingen. Een data warehouse kan, als managers de cijfers van het data warehouse eenmaal accepteren als de waarheid, veel tijd besparen.

Maar zelfs dan, levert de interpretatie van die cijfers of het benadrukken van bepaalde cijfers weer een veelheid van waarheden op waar managers weer overeenstemming over moet bereiken. Een aardig voorbeeld stond afgelopen week in de kranten. Dit waren de conclusies van de verschillende kranten nav een en hetzelfde onderzoek van Rutgers Nisso:

dinsdag, november 14, 2006

BO gaat 2.0

home_collaborator.gifInformation week heeft een artikel over de nieuwe features van Business Objects. Nu geloof ik dat meestal wel, maar deze zijn écht leuk en bijna web 2.0-achtig.

Via het ook al nieuwe BO labs waar je nieuwe features kunt testen zijn ze te downloaden (nu de beheerders nog even lief aankijken):

Een revolutie in meten

socialmed.jpg"We zijn getuige van een revolutie in het meten", vertelde Jon Kleinberg, een professor in social media analyses, op '2016', een symposium over de ontwikkelingen in computer science. Wat is dan die revolutie?
"The new social-and-technology networks that can be studied include e-mail patterns, buying recommendations on commercial Web sites like Amazon, messages and postings on community sites like MySpace and Facebook, and the diffusion of news, opinions, fads, urban myths, products and services over the Internet. Why do some online communities thrive, while others decline and perish? What forces or characteristics determine success? Can they be captured in a computing algorithm?"

Dit is ook een van de onderzoeksonderwerpen van het web science research initiative, waarvan Tim Berners Lee een van de oprichters is. Het initiatief is breder van opzet en zal de sociale en technologische gevolgen van de opkomst van het web onderzoeken:
"The Web Science Research Initiative (WSRI) will generate a research agenda for understanding the scientific, technical and social challenges underlying the growth of the Web. Of particular interest is the volume of information on the Web that documents more and more aspects of human activity and knowledge. WSRI research projects will weigh such questions as, how do we access information and assess its reliability? By what means may we assure its use complies with social and legal rules? How will we preserve the Web over time?"

Waarom ik dit blog? Ik zie allerlei nieuwsoortige analyses ontstaan die ongetwijfeld een spinoff krijgen naar BI-achtige toepassingen en web analyses.